第22章 第22章(1 / 1)

需要配备摄像头传感器的移动机器人来感知人类及其行为,以实现安全的自主导航。对于同时进行人体检测和动作识别,机器人视觉的实时性是一个重要的问题。在本文中,我们提出了一种机器人视觉系统,其中由相机传感器捕获的原始图像由光流描述。然后将这些图像用作人类和动作分类的输入。对于图像输入,开发了两个基于卷积神经网络的分类器。此外,我们描述了一种新的检测器(局部搜索窗口),用于从原始图像中裁剪目标人周围的部分图像。由于相机传感器与机器人一起移动,因此相机运动对图像中光流的计算有影响,我们通过进一步修改由相机运动引起的光流变化来解决这个问题。通过实验,我们证明了机器人视觉系统可以实时检测人类并识别动作。进一步,我们证明了移动机器人可以通过修改光流来实现人体检测和动作识别。

关键词:机器人视觉,通用物体识别,实时图像处理,cnn,光流

1介绍

为了实现安全的自主导航,移动机器人需要感知人类和他们的行为。例如,运动规划依赖于移动人类的存在或缺席。在很多情况下,移动机器人都配备了摄像传感器。由于摄像头对机器人起着视觉感知的作用,所以这种传感器被称为机器人视觉。机器人视觉对人的同时检测和动作识别的实时性是一个重要的问题。

在本文中,移动的人类是目标物体,人类的行为每时每刻都在变化。因此,要求机器人在发生变化的动作时进行识别,而不是在一系列动作之后进行识别。为了流畅的图像处理,我们的目标是将帧率加快到大于30fps,这个帧率是实时性能的一个标准。

对于实时人体检测和动作识别,我们提出了如图1所示的机器人视觉系统。机器人视觉系统由以下三种技术组成:1、基于光流的图像描述;2、两个基于卷积神经网络的分类器;3、局部搜索窗口,用于在目标人周围剪切部分图像。

近年来,人们提出了用于人体检测的深度学习方法[1-5]。这些方法可以以很高的精度实时检测人类以及许多其他物体。然而,由于这些方法中使用的输入图像仅基于红、绿、蓝(rgb)数据,因此很难同时执行人体检测和动作识别。

与一般目标识别类似,卷积神经网络(cnn)在提取图像中的时空特征而不是编码不变特征方面的有效性已被证明[6]。baccoucheet等人利用cnn成功地从电影中提取时空特征[7]。他们通过长短期记忆(lstm)成功地对各种场景中的人类行为进行了分类。一般来说,递归神经网络(rnns)对于识别一系列图像中的动作是有效的。此外,基于cnn的方法也使用了光流[8-10]。作为cnn的输入,使用了一组显示一系列动作的图像。然而,由于这些方法假设的是时间序列图像,因此很难识别动作的突然变化。为了识别正在发生的变化动作,我们将重点放在从两幅连续图像中获得的光流上。

人体检测涉及到识别人的存在,并识别在原始图像中的位置。对于识别,重复识别过程以穷尽搜索整个图像。最终,这个过程的计算成本成为一个问题,这个问题已经通过提出一种重要抽样方法来解决[11]。基于这种采样方法,已经提出了一种局部窗口检测器,即选择性窗口[12,13]。选择性窗口对于低距离搜索图像中的目标是有效的。此外,粒子滤波器已被用于人体检测和跟踪

在以前的重要抽样方法中,使用的是概率分布。分布参数,如均值和标准差,已经从光流中推导出来。基于概率分布,在人体周围生成多个局部搜索窗口,如图1所示。然后通过这些局部搜索窗口从原始图像中裁剪出部分图像。如果将部分图像分类为人类,则将相应的局部搜索窗口集成为检测窗口。之后,检测窗口从原始图像中截取另一个局部图像,并将其分类为动作之一。

所提出的机器人视觉系统使用光流作为图像描述符。对于静态相机传感器,可以通过光流来正确表示图像中的目标运动。然而,机器人视觉系统中的摄像传感器是与机器人一起运动的。由于摄像机的位置和姿态在该系统中发生了变化,因此摄像机的运动对图像中光流的计算产生了影响。因此,即使是包括背景在内的静态物体,也会被图像中的光流所表征。在这种情况下,机器人很难检测到人类并识别图像中的