![]()
机器人,认识你自己:新型视觉系统让机器赋予身体自我认知能力
在MIT计算机科学与人工智能实验室(CSAIL)的一间办公室里,一只软体机械手正小心翼翼地弯曲手指,抓取一个小物体。令人称奇的不是它的机械设计或内置传感器——事实上,这只手根本没有任何传感器。整个系统仅依赖一台摄像头,通过观察机器人的动作并利用视觉数据来控制它。
这一能力来自CSAIL科学家开发的全新系统,为机器人控制提供了一种全新视角。该系统无需手工设计的模型或复杂的传感器阵列,仅通过视觉就能让机器人学习自身如何响应控制指令。这一方法被称为"神经雅可比场"(NJF),赋予了机器人一种身体自我感知能力。相关开放获取论文已于6月25日发表在《自然》杂志上。
"这项工作标志着一种转变——从编程机器人到教导机器人,"MIT电气工程与计算机科学专业博士生、CSAIL成员、该研究首席研究员李思哲表示,"如今,许多机器人任务需要大量工程设计和编程工作。未来,我们设想只需向机器人展示要做什么,让它自主学习如何实现目标。"
这一研究的动机源于一个简单却深刻的重新定义:实现经济实惠、灵活机器人的主要障碍不在于硬件,而在于能力控制,而这可以通过多种方式实现。传统机器人被设计为刚性且传感器丰富,便于构建数字孪生体——一种用于控制的精确数学副本。但当机器人是软体、可变形或形状不规则时,这些假设便不再成立。NJF没有强迫机器人去适应我们的模型,而是反其道而行之——赋予机器人从观察中学习自身内部模型的能力。
观察与学习
这种将建模与硬件设计解耦的方式,有望大幅拓展机器人设计空间。在软体和仿生机器人领域,设计师往往需要嵌入传感器或加固结构的某些部分,仅仅是为了使建模成为可能。NJF消除了这一限制。该系统无需板载传感器或设计调整即可实现控制,设计师可以更自由地探索非常规、无约束的形态,而无需担心日后能否对其建模或控制。
"想想你是如何学会控制手指的:你摆动、观察、适应,"李思哲说,"这正是我们系统所做的。它通过随机动作进行实验,找出哪些控制信号能移动机器人的哪些部位。"
该系统已在多种机器人类型上验证了其鲁棒性。团队在气动软体机械手(可捏取和抓握)、刚性Allegro机械手、3D打印机械臂,甚至一个没有内置传感器的旋转平台上测试了NJF。在所有情况下,系统仅凭视觉和随机运动,就学会了机器人的形状及其对控制信号的响应方式。
研究人员看到了远超实验室的应用潜力。配备NJF的机器人未来有望以厘米级定位精度执行农业任务,在无需复杂传感器阵列的情况下在建筑工地作业,或在传统方法失效的动态环境中自主导航。
NJF的核心是一个神经网络,它捕捉机器人具身性的两个相互交织的方面:三维几何形状和对控制输入的响应灵敏度。该系统基于神经辐射场(NeRF)构建——这是一种通过将空间坐标映射到颜色和密度值来从图像重建三维场景的技术。NJF在此基础上进一步扩展,不仅学习机器人的形状,还学习雅可比场——一个预测机器人身体上任意点如何响应电机指令而运动的函数。
为训练该模型,机器人在多台摄像头记录结果的同时执行随机动作。整个过程无需人工监督或对机器人结构的先验知识——系统仅通过观察,就能推断出控制信号与运动之间的关系。
训练完成后,机器人只需一台单目摄像头即可实现约12赫兹的实时闭环控制,从而持续观察自身、规划并做出响应。这一速度使NJF比许多基于物理的软体机器人仿真器更具实用价值,因为后者的计算量往往过大,难以实时运行。
在早期仿真中,即便是简单的二维手指和滑块,也能仅凭少量样本学会这种映射关系。通过对特定点在动作响应下如何变形或位移进行建模,NJF构建了一张密集的可控性地图。这一内部模型使其能够在整个机器人身体上泛化运动,即便数据存在噪声或不完整也不例外。
"真正有趣的是,系统能自行找出哪些电机控制机器人的哪些部位,"李思哲说,"这不是编程实现的——它通过学习自然涌现,就像一个人摸索新设备上的按钮一样。"
软体机器人的未来
几十年来,机器人领域一直青睐刚性、易于建模的机器——比如工厂里的工业机械臂——因为其特性简化了控制。但该领域正逐渐转向能更流畅适应现实世界的软体仿生机器人。代价是什么?这类机器人更难建模。
"如今的机器人技术因昂贵的传感器和复杂的编程而让人望而却步。我们开发神经雅可比场的目标,是降低这一门槛,让机器人技术变得经济实惠、适应性强,并让更多人能够使用。视觉是一种强韧可靠的传感器,"论文通讯作者、MIT助理教授文森特·西茨曼表示,他领导着场景表示研究组,"它为机器人打开了一扇门,使其能够在杂乱、非结构化的环境中运作——从农场到建筑工地——而无需昂贵的基础设施。"
"仅凭视觉就能提供定位和控制所需的线索,从而消除对GPS、外部追踪系统或复杂板载传感器的依赖。这为机器人在非结构化环境中实现鲁棒、自适应行为打开了大门——从在室内或地下无地图导航的无人机,到在杂乱家居或仓库中作业的移动操作臂,乃至穿越崎岖地形的足式机器人,"共同作者、MIT电气工程与计算机科学教授、CSAIL主任达妮埃拉·鲁斯表示,"通过从视觉反馈中学习,这些系统建立起对自身运动和动力学的内部模型,在传统定位方法失效的场景下,实现灵活的自监督运作。"
目前,训练NJF需要多台摄像头,且每台机器人都需重新训练,但研究人员已在构想一个更易获取的版本。未来,爱好者只需用手机录制机器人的随机动作——就像租车前拍一段视频一样——然后利用这段素材创建控制模型,无需任何先验知识或专业设备。
该系统目前尚不能跨不同机器人泛化,也缺乏力觉或触觉感知,限制了其在接触密集型任务中的效果。但团队正在探索解决这些局限的新方法:提升泛化能力、处理遮挡问题,以及扩展模型在更长空间和时间跨度上的推理能力。
"正如人类对自身身体如何运动和响应指令形成直觉理解一样,NJF仅凭视觉就赋予了机器人这种具身自我感知能力,"李思哲说,"这种理解是在真实环境中实现灵活操控与控制的基础。我们的工作,本质上反映了机器人领域的一个更广泛趋势:从手动编程详细模型,转向通过观察和交互来教导机器人。"
这篇论文汇聚了西茨曼实验室在计算机视觉和自监督学习方面的工作,以及鲁斯实验室在软体机器人领域的专业积累。论文共同作者还包括CSAIL成员:电气工程与计算机科学专业博士生张安南(SM '22)、博士生陈博远、机械工程本科研究员汉娜·马图西克,以及MIT可感知城市实验室博士后刘超。该研究得到了MIT研究支持委员会所罗门·布赫斯鲍姆研究基金、MIT总统奖学金、美国国家科学基金会以及光州科学技术院的资助。
Q&A
Q1:神经雅可比场(NJF)是什么?它是如何让机器人实现自我感知的?
A:神经雅可比场(NJF)是MIT CSAIL开发的一种机器人控制系统。它的核心是一个神经网络,通过摄像头观察机器人的随机运动,同时学习机器人的三维形状和各部位对控制指令的响应方式,从而建立机器人的内部模型。整个过程无需传感器、无需人工标注,机器人仅凭视觉就能"认识"自己的身体,并实现实时闭环控制。
Q2:神经雅可比场系统目前有哪些局限性?
A:目前NJF存在几个主要局限:训练阶段需要多台摄像头,且每台机器人都需单独训练,无法跨不同机器人直接泛化;系统缺乏力觉和触觉感知,在需要大量接触的任务中效果有限;此外,对遮挡情况的处理以及长时空跨度的推理能力也有待提升。研究团队正在积极探索解决这些问题的方法。
Q3:神经雅可比场技术未来有哪些实际应用场景?
A:研究人员认为NJF的应用潜力远超实验室。未来可能的场景包括:以厘米级精度执行农业采摘任务、在无需复杂传感器的建筑工地作业、室内或地下无地图导航的无人机、在杂乱仓库或家居环境中工作的机械臂,以及穿越崎岖地形的足式机器人。此外,普通爱好者未来或许只需用手机录制机器人动作,就能为其创建控制模型。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.