深度学习在场景理解中的应用
20 使用深度学习的场景理解
20.1 引言
当机器人等智能体被部署执行复杂任务时,基于人工智能的自动化变得十分必要。场景的详细表示使机器人能够更好地感知其周围环境,从而以成功且安全的方式完成不同的任务。涉及动作规划和物体操作的任务需要在动态环境中对不同表面进行识别和定位[1–3]。
在过去十年中,基于结构光的深度感应设备受到了广泛关注。这是因为它们具有低成本的特点,并且除了彩色图像外,还能以密集深度图的形式捕获数据。卷积神经网络(CNN)提供了一种稳健方法,用于从这些设备获取的数据中提取有用信息[4–7]。在本章中,我们将讨论标准前馈卷积神经网络的基本原理(第20.2节),以及其在语义分割(第20.3节)和动作识别(第20.4节)中的应用。有关这些应用的更深入分析和最先进的解决方案,可在我们的近期出版物[6]和[7]中找到。
20.2 卷积神经网络
卷积神经网络是有向无环图。这类网络能够学习高度非线性函数。神经元是卷积神经网络内的基本单元。卷积神经网络中的每一层都由多个神经元组成。这些神经元相互连接,使得第l层神经元的输出成为第 l+ 1层神经元的输入,即
$$
a^{(l+1)} = f(W^{(l)}a^{(l)} + b^{(l)}), \tag{20.1}
$$
其中 $ W^{(l)} $ 是第 l 层的权重矩阵,$ b^{(l)} $ 是偏置项,$ f $ 是激活函数。第 l 层的激活值用 $ a^{(l)} $ 表示。训练卷积神经网络需要学习每一层的 $ W $ 和 $ b $,以最小化成本函数。形式上,给定包含 m 个训练样本的训练集 ${(x^{(1)}, y^{(1)}), …, (x^{(m)}, y^{(m)})}$,需要确定权重 $ W $ 和偏置 $ b $,使得成本最小化,即期望输出 $ y $ 与实际输出 $ f_{W,b}(x) $ 之间的差异最小。单个样本的成本函数为
$$
J(W, b; x, y) = \frac{1}{2} | h_{W,b}(x) - y |^2, \tag{20.2}
$$
其中 $ h(x) $ 给出了最后一层的激活值。
最小化是通过使用梯度下降方法迭代完成的,该方法涉及计算成本函数相对于权重的偏导数,并相应地更新权重。一次梯度下降迭代将参数 $ W, b $ 更新为:
$$
W^{(l)} = W^{(l)} - \alpha \frac{\partial}{\partial W^{(l)}} J(W, b), \tag{20.3}
$$
$$
b^{(l)} = b^{(l)} - \alpha \frac{\partial}{\partial b^{(l)}} J(W, b). \tag{20.4}
$$
反向传播算法用于计算成本函数的偏导数。
全连接层将所有隐藏单元与所有输入单元相连。在处理图像等高维数据时,这会极大地增加连接数量。如果我们将图像尺寸视为其维度,那么将每个输入像素连接到每个神经元都会带来巨大的计算开销。一张小至 100×100 像素的图像在输入层就需要 $ 10^4 \times N $ 个连接,其中 $ N $ 是第一层的神经元数量。
卷积层通过在神经元之间共享参数来建立稀疏连接。与全连接层相比,卷积层具有更少的参数,因此更容易训练。但这会带来轻微的性能下降[8]。用于图像识别的常用卷积神经网络由多个卷积层后接若干全连接层组成[8,9]。这类网络通常被称为深度网络。
20.3 语义标注
场景的密集语义标注需要为图像中的每个像素分配一个标签,该标签必须表示某种语义类别。这种标注也被称为物体类别分割,因为它将图像划分为更小的片段,其中每个片段代表一个特定的类别。语义标注具有挑战性,因为自然发生的室内和室外场景高度无约束,使得发现模式和结构的空间很小。语义类别可以是抽象的,例如“家具”,也可以是更具描述性的,例如“桌子”、“椅子”等。我们希望实现的标注越具描述性,其难度就越大。
卷积神经网络提供了一种学习语义类别的稳健方法。用于语义标注的CNN架构通常仅由卷积和池化层组成[6,5]。最后一层的通道数量等于我们想要学习的物体类别数量。 

20.3.1 相关研究
过去已提出若干改进方法,以从彩色图像中学习丰富的特征。一种方法是使用图像区域建议来训练卷积神经网络[10]。另一种方法是探索不同图像片段之间的上下文信息[11]。过去也研究了在多尺度上对超像素进行分类的方法[12]。另一种可能性是通过附加一系列反卷积和非池化层,实现网络的端到端训练[13]。最近,研究表明对用于分割和图像分类的解耦深度网络进行联合训练有助于提升语义分割结果[14]。
针对语义标注已提出多种不同方法,这些方法同样利用了RGB-D图像中的深度信息。文献[15]提出了一种深度归一化方案,将最远点的相对深度设为1。文献[16,17]研究了将地面上方高度作为附加特征的可行性。文献[15]提出了一种边界外壳启发式方法,以利用室内特性。
在我们最近的研究[6]中,提出了一种新特征 distance-from-wall。该特征用于突出显示通常位于室内场景中检测到的墙壁附近物品。
用于评估不同图像分割方法的常用数据集包括PASCAL视觉物体类别数据集[23],对于 RGB-D 数据则包括NYU-v2数据集[24]和SUN RGB-D数据集[25]。
展示了在 NYU-v2 数据集上针对四个语义类别的最新结果,这些类别由西尔伯曼和弗格斯定义[24]。这些类别根据其在场景中的物理作用进行定义,即“地板”、“结构”(如墙壁、天花板和柱子)、“家具”(如桌子、梳妆台和柜台)以及“物品”(即可移动的物体)。图20.2 展示了一些由侯赛因等人实现的语义标注结果示例[6]。
20.4 动作识别
从视频中识别人类行为对于理解动态场景至关重要。识别通常通过处理包含特定行为的视频并进行预测来完成,一个标签作为输出。动作识别是一项具有挑战性的任务,因为相似的动作可能以不同的速度执行,并且在不同的视角、光照条件和背景下录制。
卷积神经网络提供了一种从视频中识别动作的方法。使用卷积神经网络的最基本方法是将视频的每一帧视为一幅图像,对每一帧预测动作,然后对所有预测结果进行平均。 展示了一个使用卷积神经网络的基本动作识别流程。
过去已经表明,一个在某个数据集上训练的卷积神经网络模型可以迁移到其他视觉识别任务[26,27]。我们也看到这种迁移学习技术被成功应用于动作识别。这是通过使用预训练图像识别模型对视频的各个帧[7,28,29]来实现的。
20.4.1 相关研究
人们已尝试使动作识别对不同情境具有不变性。这包括使用光流作为附加信息[28] 或使用3D(时空)卷积核[7,30]。循环神经网络也被用于学习不同类型动作中的长期依赖关系[31]。还提出了以无监督方式学习动作表示的方法[32]。该方法涉及使用长短期记忆(LSTM)网络对视频进行编码,然后对其进行重构。最近,提出了动态图像的概念[33]。动态图像编码了视频的时间演化信息,并用于动作识别任务。
在我们最近的研究中,我们展示了如何通过结合迁移学习技术和包含三维卷积的深度网络来实现动作识别[7]。用于基准测试不同方法的常用数据集包括UCF-101数据集[34], HMDB数据集[35]以及 Sports-1M数据集[29]。 展示了针对UCF-101数据集101个动作类别的部分最先进结果。,摘自我们之前的一项研究[7],显示了来自UCF-101数据集的部分序列的前5个预测结果。可以看出,在视觉上相似环境中执行的动作通常会被以较大概率预测。例如,考虑图20.4(c6)与图20.4(b3)。 展示了使用我们在[7]中所述方法对HMDB数据集动作序列生成的混淆矩阵。可以看出,“剑术练习”和“拔剑”等相似动作存在一定程度的混淆。
20.5 结论
我们介绍了卷积神经网络在语义标注任务中的基本思想。我们讨论了通过提取场景中的不同特征(例如distance-from-wall)来进一步提升分割结果的多种方法。语义标注可作为物体发现方法的有效先验,这一点在我们之前的一项研究[42]中已有展示。
我们还解释了使用卷积神经网络识别视频中动作的基本方法。同时概述了当前最先进的卷积神经网络以及实现鲁棒性的不同方法。
更多推荐


所有评论(0)