联系我们
- 地 址:北京市海淀区北四环西路9号 ,主 营:人脸识别,活体检测,身份证识别,银行卡识别,名片识别,车牌识别,OCR识别等及智能识别技术。
- 电 话:13146317170 廖经理
- 传 真:
- 邮 箱:398017534@qq.com
AI机器人实现视觉自适应
AI机器人实现视觉自适应
人们十分擅长操作物体,而无需将视角调整到某一固定或特定位置。这种才能(称为视觉动作整合)在孩童时期经过在各种情境中操作物体而习得,并由一种应用丰厚的感官信号和视觉作为反应的自顺应纠错机制控制。不过,关于机器人技术中基于视觉的控制器而言,想要具备这种才能却非常艰难。
直到如今,这种控制器都基于一种用于从固定装置式摄像头读取视觉输入数据的固定安装,锻炼和测试过程中不能挪动或重新调整摄像头的位置。在视角大幅变化的状况下快速获取视觉运动控制技艺的才能将对自主机器人系统产生严重影响。例如,这种才能关于参与紧急状况或灾区救援工作的机器人来说特别必要。
在本周的 CVPR 2018 大会上,我们提交了名为“Sim2Real Viewpoint Invariant Visual Servoing by Recurrent Control”的论文。在这篇论文中,我们研讨了一种新型深度网络架构(由两个完整卷积网络和一个长短期记忆单元组成),该架构能够从过去的动作和察看结果学习以停止自校准。我们的视觉顺应网络应用由演示轨迹和强化学习目的组成的各种模仿数据,可以从各种视角控制机械臂抵达各种视觉指示目的,并且不依赖于摄像头校准。
这里写图片描绘
用物理机械臂抵达视觉指示目的的视角不变操作
我们学习了一种战略,能够经过从截然不同的摄像头视角捕获的感官输入抵达不同的目的
第一行所示为视觉指示目的
应战
经过从未知视角捕获的单一图像剖析可控自在水平 (DoF) 对视觉运动的影响可能不够明白和详细。肯定动作对图像-空间运动的影响并胜利执行所需的任务需求一个具备对过去动作的记忆才能的强大感知系统。要处理这一具有应战性的问题,我们必需处理以下根本问题:
• 如何提供恰当的经历,让机器人在模仿终身学习范式的纯视觉察看的根底上学习自顺应行为?
• 如何设计一个集强大感知和自顺应控制于一体并可以快速转移到未知环境的模型?
为此,我们设计了一个新的操作任务,为一个七自在度机械臂提供一种物体的图像,并指示它在一系列干扰物中拿到特定的目的物体,同时每一次实验的视角会发作宏大变化。经过这种方式,我们可以模仿复杂行为的学习以及向未知环境的转移。
用物理机械臂和各种摄像头视角完成抵达视觉指示目的的任务
这里写图片描绘
应用模仿学习复杂行为
搜集机器人经历数据费时费力。在之前的博文中,我们展现了如何经过将数据搜集和实验分配给多个机器人来扩展学习技艺。虽然这种办法加快了学习速度,但学习视觉自校准等复杂行为依然不可行,学习复杂行为时需求我们将机器人置于包含各种视角的大型空间中。
因而,我们选择在模仿中学习此类复杂行为,我们能够搜集无限的机器人实验数据,并轻松将摄像头移到各个随机视角。除了在模仿中快速搜集数据外,我们还能够摆脱在机器人四周装置多个摄像头的硬件限制。
我们在模仿中运用域随机化技术来学习可泛化的战略。
为了学习要向未知环境转移的强大视觉特征,我们运用了 Sadeghi & Levine 在 2017 年提出的一项称为“域随机化”(又名“模仿随机化”)的技术,使机器人可以完整在模仿中学习基于视觉的战略,从而能够泛化到理想世界。这项技术已被证明适用于各种机器人任务,例如室内导航、物体定位以及选择和放置等。此外,为了学习自校准等复杂行为,我们应用模仿功用来生成合成演示并分离强化学习目的来学习强大的机械臂控制器。
这里写图片描绘
用模仿的七自在度机械臂抵达视觉指示目的的视角不变操作
我们学习了一种战略,能够经过从截然不同的摄像头视角捕获的感官输入抵达不同的目的
将感知与控制别离
为了可以快速转移到未知环境中,我们设计了一个深度神经网络,将感知和控制相分离,并同时停止端到端锻炼,且在必要状况下允许二者分别停止学习。将感知与控制别离让转移到未知环境变得容易,并且使得模型既灵敏又高效,由于它的每个局部(即“感知”或“控制”)能够运用少量数据单独顺应新环境。
另外,固然网络的控制局部完整运用模仿数据锻炼,但网络的感知局部经过用物体边境框搜集少量静态图像来补充,而不需求用物理机器人搜集整个动作序列轨迹。在理论中,我们只用了来自 22 个图像的 76 个物体边境框来微调网络的感知局部。
这里写图片描绘
理想世界的机器人和挪动摄像头设置第一行所示为场景布置,第二行为机器人的视觉感官输入
早期结果
我们在物理机器人和真实物体上测试了视觉顺应版本的网络,这些物体的外观与模仿中运用的完整不同。在实验中,桌子上会呈现一个或两个物体 -“见过的物体”(如下图所示)用于视觉顺应,实验中运用的是小型静态真实图像集。在视觉顺应期间没有看到“未见过的物体”。在测试过程中,指示机械臂从各个视角抵达视觉指示物体。关于双物体实验,第二个物体用于“迷惑”机械臂。
由于纯模仿网络具有良好的泛化才能(由于它是运用域随机化技术停止锻炼的),加上我们的网络架构十分灵敏,因而,固然实验中仅搜集了十分少量的静态视觉数据用于视觉顺应,控制器的表现依然有了很大提升。
这里写图片描绘
在运用少量真实图像停止视觉特征顺应后,性能进步了10% 以上。运用的一切真实物体都与模仿中看到的物体截然不同。
我们以为,学习在线视觉自顺应是一个重要而又具有应战性的课题,其目的是学习可泛化战略,让机器人可以在多样化、非构造型理想世界中运转。我们的办法能够延伸到任何类型的自动自校准。
直到如今,这种控制器都基于一种用于从固定装置式摄像头读取视觉输入数据的固定安装,锻炼和测试过程中不能挪动或重新调整摄像头的位置。在视角大幅变化的状况下快速获取视觉运动控制技艺的才能将对自主机器人系统产生严重影响。例如,这种才能关于参与紧急状况或灾区救援工作的机器人来说特别必要。
在本周的 CVPR 2018 大会上,我们提交了名为“Sim2Real Viewpoint Invariant Visual Servoing by Recurrent Control”的论文。在这篇论文中,我们研讨了一种新型深度网络架构(由两个完整卷积网络和一个长短期记忆单元组成),该架构能够从过去的动作和察看结果学习以停止自校准。我们的视觉顺应网络应用由演示轨迹和强化学习目的组成的各种模仿数据,可以从各种视角控制机械臂抵达各种视觉指示目的,并且不依赖于摄像头校准。
这里写图片描绘
用物理机械臂抵达视觉指示目的的视角不变操作
我们学习了一种战略,能够经过从截然不同的摄像头视角捕获的感官输入抵达不同的目的
第一行所示为视觉指示目的
应战
经过从未知视角捕获的单一图像剖析可控自在水平 (DoF) 对视觉运动的影响可能不够明白和详细。肯定动作对图像-空间运动的影响并胜利执行所需的任务需求一个具备对过去动作的记忆才能的强大感知系统。要处理这一具有应战性的问题,我们必需处理以下根本问题:
• 如何提供恰当的经历,让机器人在模仿终身学习范式的纯视觉察看的根底上学习自顺应行为?
• 如何设计一个集强大感知和自顺应控制于一体并可以快速转移到未知环境的模型?
为此,我们设计了一个新的操作任务,为一个七自在度机械臂提供一种物体的图像,并指示它在一系列干扰物中拿到特定的目的物体,同时每一次实验的视角会发作宏大变化。经过这种方式,我们可以模仿复杂行为的学习以及向未知环境的转移。
用物理机械臂和各种摄像头视角完成抵达视觉指示目的的任务
这里写图片描绘
应用模仿学习复杂行为
搜集机器人经历数据费时费力。在之前的博文中,我们展现了如何经过将数据搜集和实验分配给多个机器人来扩展学习技艺。虽然这种办法加快了学习速度,但学习视觉自校准等复杂行为依然不可行,学习复杂行为时需求我们将机器人置于包含各种视角的大型空间中。
因而,我们选择在模仿中学习此类复杂行为,我们能够搜集无限的机器人实验数据,并轻松将摄像头移到各个随机视角。除了在模仿中快速搜集数据外,我们还能够摆脱在机器人四周装置多个摄像头的硬件限制。
我们在模仿中运用域随机化技术来学习可泛化的战略。
为了学习要向未知环境转移的强大视觉特征,我们运用了 Sadeghi & Levine 在 2017 年提出的一项称为“域随机化”(又名“模仿随机化”)的技术,使机器人可以完整在模仿中学习基于视觉的战略,从而能够泛化到理想世界。这项技术已被证明适用于各种机器人任务,例如室内导航、物体定位以及选择和放置等。此外,为了学习自校准等复杂行为,我们应用模仿功用来生成合成演示并分离强化学习目的来学习强大的机械臂控制器。
这里写图片描绘
用模仿的七自在度机械臂抵达视觉指示目的的视角不变操作
我们学习了一种战略,能够经过从截然不同的摄像头视角捕获的感官输入抵达不同的目的
将感知与控制别离
为了可以快速转移到未知环境中,我们设计了一个深度神经网络,将感知和控制相分离,并同时停止端到端锻炼,且在必要状况下允许二者分别停止学习。将感知与控制别离让转移到未知环境变得容易,并且使得模型既灵敏又高效,由于它的每个局部(即“感知”或“控制”)能够运用少量数据单独顺应新环境。
另外,固然网络的控制局部完整运用模仿数据锻炼,但网络的感知局部经过用物体边境框搜集少量静态图像来补充,而不需求用物理机器人搜集整个动作序列轨迹。在理论中,我们只用了来自 22 个图像的 76 个物体边境框来微调网络的感知局部。
这里写图片描绘
理想世界的机器人和挪动摄像头设置第一行所示为场景布置,第二行为机器人的视觉感官输入
早期结果
我们在物理机器人和真实物体上测试了视觉顺应版本的网络,这些物体的外观与模仿中运用的完整不同。在实验中,桌子上会呈现一个或两个物体 -“见过的物体”(如下图所示)用于视觉顺应,实验中运用的是小型静态真实图像集。在视觉顺应期间没有看到“未见过的物体”。在测试过程中,指示机械臂从各个视角抵达视觉指示物体。关于双物体实验,第二个物体用于“迷惑”机械臂。
由于纯模仿网络具有良好的泛化才能(由于它是运用域随机化技术停止锻炼的),加上我们的网络架构十分灵敏,因而,固然实验中仅搜集了十分少量的静态视觉数据用于视觉顺应,控制器的表现依然有了很大提升。
这里写图片描绘
在运用少量真实图像停止视觉特征顺应后,性能进步了10% 以上。运用的一切真实物体都与模仿中看到的物体截然不同。
我们以为,学习在线视觉自顺应是一个重要而又具有应战性的课题,其目的是学习可泛化战略,让机器人可以在多样化、非构造型理想世界中运转。我们的办法能够延伸到任何类型的自动自校准。
上一条:机器学习概述
下一条:移动端OCR身份证识别技术