教机器人像人一样灵巧地操纵物体,这仍然是机器人技术中最大的挑战之一。一项新研究表明,答案可能不是给机器人喂更复杂的训练数据,而是给它们更统一的例子来学。
纽约大学坦登工程学院和机器人与人工智能研究所的研究人员发现,用结构化、可预测的演示训练的机器人,比用变化很大的例子训练的机器人表现好得多。这项工作可能有助于改进机器人学习复杂手部动作、换抓握方式、多肢体协调等任务的方式。
很多机器人学习系统靠模仿学习,就是机器照着人类做的示范动作来学。但收集高难度灵巧任务的示范很困难,因为遥操作系统很难捕捉到精细的手指动作和复杂的接触互动。
为了克服这个限制,研究人员改用运动规划算法,在物理模拟中自动生成示范。机器人不跟人学,而是学软件生成的虚拟例子。
团队很快就发现了问题。被称为快速探索随机树(RRTs)的流行规划方法产生的解决方案在不同示范之间差异过大,这使得机器人难以识别它们应当模仿的行为。
一致性比随机性更靠谱
“这些规划方法很擅长找解决方案,”第一作者朱华江(Huaijiang Zhu)说。
“但当每个方案看起来都不一样时,学习系统就懵了,不知道要模仿哪个行为。”
据研究人员称,RRT(快速探索随机树)生成的演示中的随机性产生了所谓的高熵数据。虽然这种多样性有助于规划算法探索不同的解决方案,但这种多样性可能降低模仿学习的有效性。
为了解决这个问题,团队开发了替代性规划方法,旨在生成更一致的演示。一种方法注重稳步朝目标推进,而另一种方法则依赖预定义动作库来减少示例之间的差异。
研究人员使用两项具有挑战性的操作任务评估了该方法。在一项实验中,两个机械臂必须将一个大圆柱体旋转180度,同时反复调整各自的抓握方式。在另一项实验中,一只灵巧的机械手在手掌中转动立方体,以对准目标方向。
虚拟教学,实打实的效果
机器人用更一致的演示数据训练的机器人,成功率明显更高,远超那些用标准RRT生成数据训练的机器人。在双臂任务中,仅用100组示范数据,系统就达到了近乎完美的表现。
研究团队还把学到的策略直接从模拟环境搬到了真实硬件上,不用再额外训练。双臂机器人在实际测试中成功率达到了90%,而机械手这边,大概62%的尝试能成功。
这些结果说明机器人领域有个越来越明显的趋势,就是把传统运动规划和机器学习结合起来。研究人员不再把这两种方法割裂开,而是越来越多地用规划算法来给学习系统生成训练数据。
这项研究还印证了人工智能领域的一个更普遍的规律:数据量增大并不总能带来更好的学习效果。在某些情况下,精心设计的例子可能比大量杂乱或不一致的演示更有价值。
这项研究发表在《IEEE机器人与自动化快报》期刊上。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.