网易首页 > 网易号 > 正文 申请入驻

北大造出会"听指挥"的灵巧机器人手:从看人类做饭学会干活的?

0
分享至


这项由北京大学人工智能研究院与北大-PsiBot联合实验室主导、联合宾夕法尼亚大学共同完成的研究,于2026年6月以预印本形式发布,论文编号为arXiv:2607.09701。研究提出了一套名为EgoSteer的完整机器人操控系统,旨在让双手灵巧机器人能够理解人类的自然语言指令并完成各种复杂操作任务。

你有没有想过,教一个孩子学做饭,最自然的方式是什么?大概不是给他一本厚厚的操作手册,而是让他站在厨房里,看大人怎么切菜、怎么翻炒、怎么把盘子端到桌上。孩子通过观察大量真实的操作过程,慢慢就懂了——什么叫"炒至金黄",什么叫"轻轻搅拌"。

北京大学的研究团队做的事情,本质上和这个道理一模一样。他们想让机器人也能通过"看别人做"来学会干活,而且不只是机械地复现动作,而是真正听懂人类用自然语言说出的指令,比如"把茶叶放进茶壶"或者"把手机放到支架上",然后自己去完成。

这听起来简单,但在机器人研究领域,这件事长期以来极其困难。现有的大多数机器人系统要么只能做一两个固定任务,要么虽然号称"通用",但实际上只能控制简单的夹爪式机械手,完全没有真正意义上的手指灵巧度。而配备多根手指的灵巧机器人手虽然在动作丰富度上远胜夹爪,但训练起来需要的数据量大得吓人,而且专门为机器人收集的操作演示数据向来费时费力、成本高昂。

研究团队的核心突破在于:他们意识到人类自己每天产生的第一视角视频——也就是佩戴头部摄像头拍摄的,看到自己双手在操作的那种视频——本质上就是天然的学习素材库。全世界已经积累了超过十一万小时这样的视频,里面记录了人类如何拿起物体、如何摆放、如何用工具。如果能从这些视频里提炼出有效的训练信号,再把它迁移到真正的机器人身上,就相当于给机器人配备了一个从海量人类操作经验中自学而来的"肌肉记忆"。

这套系统由三个紧密咬合的部分组成:一个叫EgoSmith的数据处理流水线,一套统一的机器人操控平台,以及一个叫EgoSteer的核心模型。下面就一层层把这三件事说清楚。

一、EgoSmith:把乱糟糟的生活视频变成高质量教材

原始的第一视角视频就像一堆未经整理的录像带——有人在走路、有人在聊天、有人的手根本就没在干什么有意义的事。把这些统统塞给机器人学习,不仅没用,反而会把它教坏。研究团队因此设计了一条名为EgoSmith的四步精炼流程,就像一家专门处理食材的中央厨房,把进来的生货变成可以直接下锅的净料。

第一步是"初筛",也就是预过滤。系统会先快速扫描每一段视频,把那些明显没价值的内容扔掉。具体来说,它会分析视频里的画面运动模式:如果镜头在大范围移动,说明拍摄者正在走路,这段视频就没用;如果画面里看不到手,或者手被遮挡了,同样跳过。这一步用的是一种叫做光流的技术,可以理解成"追踪画面里每个点的流动方向",就像看水流的纹路判断河道走向一样。与此同时,系统还会用一个叫YOLO的图像识别工具来检测画面里有没有清晰可见的双手,如果手的位置或大小不对劲,也会被过滤掉。

第二步是"四维动作重建",这是整个流程里技术含量最高的环节。经过初筛的视频只是普通的二维画面,但研究团队需要知道手在三维空间里的真实位置和运动轨迹。他们用一个叫DPVO的相机追踪算法来估算摄像头在空间中的移动路径,再用一个叫Any4D的工具来估算场景中物体的真实距离,把两者结合起来,就能把画面里的手从二维坐标换算成真实世界里的三维坐标。打个比方:这就像你拿着一张照片,通过照片里的透视关系和物体的已知大小,反推出拍照时你站在哪儿、手伸到了多远。

经过这一步改良,系统的处理速度比此前最先进的同类工具HaWoR快了整整九倍,同时准确度也全面提升——在衡量手部追踪精度的四项指标上均胜出,其中最关键的"世界坐标手部关节误差"从106.9毫米降到了86.0毫米。

第三步是"语言标注"。光有动作数据还不够,系统还需要知道每段视频里的手在做什么,这样才能让机器人学会把语言指令和具体动作对应起来。研究团队调用了一个强大的视觉语言模型Qwen3.5-VL-Plus,让它自动为每段视频生成五个层次的文字描述。第一层最简短,只有动词加名词,比如"装饰蛋糕";第二层是一句话的概要,比如"把蓝色纸张固定在蛋糕周围";第三层聚焦于被操作的物体,描述其特征和位置;第四层聚焦于双手各自的角色和动作细节;第五层则是分步骤的详细过程描述,几乎像一份操作说明。这种从粗到细的分层标注,让机器人能够理解不同详细程度的语言指令,不管你说"拿起蛋糕"还是"用左手稳住蛋糕底部同时右手缠绕包装纸",它都能对应起来。

第四步是"质量把关",在三个粒度上进行最终筛查。在整段视频的层面,系统检查摄像头的运动统计是否异常,头部晃动过猛的片段会被丢弃;在几秒钟长的片段层面,检查手的位置是否在合理范围内,毕竟人类的手再怎么伸,也不可能离头部超过1.5米;在逐帧的层面,检查相邻帧之间的动作跳变是否超过了人类生理极限,超过的就认为是数据错误,同样去掉。

经过这套流程,研究团队从十二个不同来源的第一视角数据集中,整理出了一个包含9600小时、超过两百万段视频、共十亿帧图像的预训练语料库。这些数据覆盖了8969种不同的被操作物体和623种动作词汇,从日常的拿起放下,到复杂的组装焊接,应有尽有。

二、统一机器人操控平台:让人类随时能"接管"机器人

有了大量人类操作的视频数据作为"课本",下一步是让机器人真正在现实世界里把这些知识用上。问题是,人类的手和机器人的手结构不同,人类视频里的视角也和机器人摄像头的视角有差异。要弥补这个鸿沟,就需要额外收集机器人自己实际操作的演示数据,也就是让人类直接远程操控机器人做各种任务,录下来作为"接地气"的训练素材。

研究团队开发的这套机器人操控平台做了一件很聪明的事:它让遥控操作、模型自动执行、以及人类随时介入纠错这三件事共用同一套底层控制代码。这意味着什么?意味着不管是人在操控,还是AI在执行,机器人的手臂和手指都走完全一样的运动路径,不会因为切换模式而产生任何额外的误差。

具体实现上,操控者戴上专门的手套和手腕追踪器,系统会实时捕捉操控者双手的姿态,然后把这些姿态转换成机器人手臂和手指的目标位置。两台机器人手臂和两只六自由度灵巧机器人手会跟随操控者的动作同步运动。

更关键的是"随时接管"功能。在机器人自动执行任务的过程中,如果它做错了什么——比如夹歪了、放偏了——旁边的人类专家可以踩一下脚踏开关,立刻接管控制权,帮机器人纠正动作,纠正完再踩一下把控制权还给AI继续执行。但问题来了:当人类接管的那一刻,机器人的状态和人类手的状态可能完全不同,如果直接切换,机器人会因为两者之间的位置差突然"跳一下",不仅吓人,还可能损坏设备或物体。

研究团队提出的解决方案非常优雅:接管的那一刻,系统不是让机器人直接跟着人类的手走,而是只记录人类手在之后的相对移动量,然后把这个相对移动量叠加到机器人当前位置上。就像你骑自行车转弯,不是要求你的身体突然移到某个绝对位置,而是你扭多少度,车头就跟着转多少度。这样切换就变得完全平滑,这套机制实现了超过85%的接管成功率。

利用这套平台,研究团队让操控者在真实的机器人上演示了193种不同的操控任务,涵盖从简单的拿起放下,到需要双手配合的复杂操作,再到需要精细物理接触的任务,比如用海绵擦盘子、用熨斗熨衣服、在白板上写字。场景布置刻意保持混乱和随机,桌布颜色、物体种类和摆放位置每次都不同,这样收集到的数据才更贴近真实世界的多样性。最终收集了187小时、超过五万五千段演示,并用语言模型自动生成了多层次的文字描述,再经过人工核验。

三、EgoSteer模型:一个装了"预见未来"能力的机器人大脑

有了九千多小时的人类操作数据,再加上一百多小时的机器人演示数据,现在需要的是一个能把这些数据转化为实际操控能力的模型。研究团队提出的EgoSteer就是这个"大脑"。

EgoSteer的核心结构可以理解为两个专家的协作。第一个专家是"语言视觉理解专家",负责看懂眼前的画面、读懂语言指令、理解当前局面。研究团队用的是Qwen3-VL这个成熟的视觉语言模型的2B版本作为骨干,它本身就具备很强的图像理解和语言理解能力。第二个专家是"动作生成专家",负责把前者的理解转化成具体的机器人运动指令,生成一系列连续的手腕位姿和手指关节目标位置。这个动作专家采用的是一种叫做流匹配的技术,可以把它理解成:先把目标动作想象成一团随机噪声,然后一步步把它"雕刻"成清晰精确的运动轨迹。

为了让人类操作数据和机器人数据能无缝对接,研究团队统一了两者的数据格式:无论是人类视频还是机器人演示,动作都被表达为手腕在三维空间中的位置和朝向,加上十五个手指尖关键点的位置,共四十八个数值。人类的手和机器人的手虽然外形不同,但都可以用这套统一语言描述,就像不同语言的文字都可以翻译成国际音标一样。

EgoSteer的一个特别设计是"实时分块执行"机制。机器人在执行动作时,模型每次要生成未来一段时间内的动作序列,但生成这个序列本身需要一定时间。如果等模型算好了再让机器人动,机器人就会周期性地"卡一下",这在精细操作中是致命的。研究团队的解决方案是:模型在生成一段新动作序列时,把序列开头的几步作为"已知"输入,然后只预测后面的部分;与此同时,机器人就用开头的那几步继续执行,等后面的预测算好了,再无缝衔接上去。这样机器人的动作就始终是连续的,不会出现卡顿。

更有意思的是EgoSteer里的第三个模块——"世界模型专家"。这是一个只在训练时使用、推理时完全丢弃的辅助网络。它的任务是:根据当前的画面和即将执行的动作序列,预测未来某个时刻的画面会长什么样——不是预测真实像素,而是预测一种叫DINOv3的视觉编码器提取出的深层语义特征。可以把它理解为:不是预测"屏幕上会显示什么颜色",而是预测"这个场景的语义本质会变成什么"。这种对未来的预判能力,会通过训练过程中的梯度反传,实实在在地改善"语言视觉理解专家"的表征质量,让它在理解当前局面时就自然地考虑到动作的后果。训练完成后,这个世界模型专家就被丢弃,推理时不消耗任何额外计算资源。

整个训练过程在工程优化上也下了很大功夫。系统采用了一种叫HSDP的分布式训练策略,让计算和通信可以同时进行而不互相等待;用FlexAttention来优化注意力计算;用WebDataset格式进行顺序数据流读取,大幅降低了存储系统的读取压力。最终系统在八块A800显卡的单台服务器上达到了97个样本每秒的训练速度和44.5%的理论计算峰值利用率,并且几乎线性地扩展到了128块显卡的规模。

四、实验结果:这个机器人到底有多能干?

研究团队对EgoSteer进行了一系列严格的测试,测试场景全部是真实的机器人在真实的桌面上完成真实的任务,没有任何简化或模拟。

在核心的多任务指令跟随测试中,研究团队在九千六百小时的人类视频上预训练,再在一百八十七小时的机器人演示上后训练,最后还做了三轮DAgger纠错优化(下文详述),然后测试机器人能否在自由形式的语言指令下完成超过四十个不同的任务。结果显示,整体平均成功率达到75%,有22个任务的成功率在80%以上。更重要的是,机器人在面对杂乱的桌面时,能够严格按照语言指令选择正确的目标物体和正确的操作手法,而不是随便拿个什么东西就动。它还能在一次尝试失败后自动重试,表现出鲁棒性。

在四个从未见过的全新组合任务上,机器人平均成功率为65%;在四个完全陌生动作语义的任务上,成功率为62%。这说明机器人不只是在背题库,而是真正理解了操作的内在逻辑,能够迁移到新情境。

另一个重要测试验证了DAgger纠错机制的价值。研究团队比较了两种训练方式:一种只用遥控演示数据,另一种在此基础上加了三轮人类介入纠错,每轮采集纠错数据并重新训练。在四个特别棘手的任务上,只用演示数据的模型平均成功率只有22.5%,而加了纠错之后飙升至62.5%,总共只用了8.3小时的纠错数据。效果之显著,成本之低,令人印象深刻。

预训练数据量对最终效果的影响也得到了系统性验证。研究团队分别用三千小时、六千小时和九千六百小时的数据预训练,再加上一个完全从零训练的对照组,在同样的十个任务上测试。结果非常清晰:从零训练只有30%成功率,三千小时预训练提升到40%,六千小时达到43%,九千六百小时达到60%。预训练损失曲线也随着数据量增加持续下降,没有出现平台期,说明更多数据还会带来更多收益。

与两个强基线系统的比较结果同样突出。π0.5和Being-H0.5都是近期发表的优秀机器人大模型,研究团队把它们也在自己的机器人演示数据上训练后进行对比。在同样十个任务上,π0.5平均成功率22%,Being-H0.5为39%,而EgoSteer达到74%。研究团队分析认为,这两个基线系统的预训练和后训练阶段的动作表示方式不统一,而且它们使用的图像分辨率较低,也缺少实时分块执行这样的部署优化。

消融实验(也就是逐一去掉某个模块看效果下降多少的测试)则验证了每个设计决策的必要性。去掉世界模型专家,成功率从44%跌至31%;关掉实时分块执行机制,成功率跌至39%,而且接触类任务因为动作抖动几乎全部失败;用没有经过EgoSmith过滤的原始噪声数据,成功率只剩33%,语言理解和动作精度都严重下降。

五、从"快速上手"到"举一反三":几步就学会折箱子

最后一个测试场景是研究团队最引以为傲的部分:EgoSteer的预训练模型在只有少量演示的情况下,能否快速学会全新的、极其复杂的长流程任务?

研究团队选了两个任务。第一个是在RealMan机器人上"折叠纸箱",这个任务需要连续完成18个步骤,整个过程耗时40秒,涉及大量精准的双手协调和物理接触。第二个是在AgiBot G1机器人上"拆蛋糕包装盒",需要9个步骤,耗时约一分钟。两项任务都在从未见过这些任务的机器人上进行,都使用随机的初始物体位置,都只提供了非常有限的演示数量——折箱子用了120段演示,拆包装盒用了229段。

结果是:EgoSteer预训练模型经过快速微调后,折箱子成功率75%,拆包装盒成功率83%。而那些没有预训练的对照组呢?无论是扩散策略(Diffusion Policy)、隐式最大似然估计(IMLE),还是从零训练的EgoSteer,在这两个任务上的成功率统统是0%。任务完全无法完成。这个对比结果非常有力地说明:正是那九千六百小时的人类操作预训练,给机器人装上了一套关于"手该怎么动"的底层物理直觉,让它面对全新复杂任务时能够快速适应,而不是从一片空白开始摸索。

归根结底,这套系统解决的是一个很根本的问题:如何让机器人在无需大量专门针对它定制的训练数据的情况下,依然能够掌握丰富的操控技能并听懂人类的自然语言。答案是:充分利用人类自己产生的大量第一视角视频,用精心设计的数据处理流程提炼出高质量的训练信号,再用一个架构合理、训练目标设计周全的模型来消化这些信号,最后通过少量的机器人专属演示和人类介入纠错来落地。

当然,研究团队自己也坦承了几个尚未解决的问题。机器人的自由度限制让它无法完美复现人类手部最精细的动作;系统缺少触觉反馈,在需要感知力度的任务上还有明显短板;预训练数据的规模可以继续扩大。这些都留给了未来的研究去继续推进。

对普通人来说,这意味着什么?也许再过不太久,你家里的机器人助手就不再需要你用专门的遥控界面一步一步发指令,而是可以直接告诉它"帮我把快递箱子拆开",然后看着它思考一两秒,再灵活地用双手把事情干完。而这一切能力的来源,是它在某个数据中心里默默"看"了数以亿计帧的人类日常操作视频。

有兴趣深入了解技术细节的读者,可以通过arXiv编号2607.09701查阅完整论文,研究团队也承诺开源全套系统代码、数据集和模型权重,项目主页为egosteer.github.io。

Q&A

Q1:EgoSmith数据处理流水线比之前的HaWoR工具强在哪里?

A:EgoSmith在处理速度上快了整整九倍,同时追踪精度也全面超过HaWoR。它的核心改进是把HaWoR依赖的DROID-SLAM相机追踪算法换成了更轻量稳定的DPVO,并引入Any4D来估算真实物理尺度,让手部在三维空间中的位置估计更准确。此外EgoSmith还增加了多层质量过滤机制,能自动丢弃因头部抖动或算法漂移产生的错误数据。

Q2:EgoSteer的世界模型专家在推理时为什么可以直接丢弃?

A:世界模型专家的作用发生在训练阶段,它通过预测未来帧的语义特征,给视觉语言理解模块施加额外的梯度信号,促使主干网络学到更有利于动作预测的表征。这种影响已经被"烙印"进模型权重里了。推理时不再需要这个辅助网络,去掉它既不影响效果,又节省了计算资源,可以说是一种只花训练成本、不花推理成本的提升方式。

Q3:DAgger纠错是怎么收集数据的,为什么只需要8小时就能大幅提升成功率?

A:DAgger的做法是让机器人自己跑任务,在它出错的时候人类专家通过脚踏开关接管控制、纠正动作,再把这段纠错过程录下来加入训练数据,重新训练后再继续部署。因为收集的都是真实失败场景的纠正示范,针对性极强,所以少量数据就能显著改善策略在部署时的实际表现。研究团队只用了8.3小时的纠错数据,就把四个难度较高任务的平均成功率从22.5%提升到了62.5%。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
长鑫科技:股票将于7月27日在科创板上市

长鑫科技:股票将于7月27日在科创板上市

界面新闻
2026-07-23 19:05:51
美国:苹果不准买中国存储芯片!苹果:那iPhone贵一倍你给我报?

美国:苹果不准买中国存储芯片!苹果:那iPhone贵一倍你给我报?

叮当当科技
2026-07-23 11:08:54
印媒:辛杜尔行动中,巴预警机掉头就跑,仍被S-400导弹314公里外击落

印媒:辛杜尔行动中,巴预警机掉头就跑,仍被S-400导弹314公里外击落

止戈军是我
2026-07-23 06:45:07
建业30亿卖掉“只有河南”和电影小镇

建业30亿卖掉“只有河南”和电影小镇

听心堂
2026-07-23 19:26:20
重庆一网约车失控撞入炸鸡店,行人四处躲闪、店内顾客受到惊吓,疑因驾驶员操作不当

重庆一网约车失控撞入炸鸡店,行人四处躲闪、店内顾客受到惊吓,疑因驾驶员操作不当

台州交通广播
2026-07-23 21:57:47
菲尔兹奖没有意外!两位中国籍数学家创造历史

菲尔兹奖没有意外!两位中国籍数学家创造历史

返朴
2026-07-23 22:11:00
图片报:博阿滕解除奥利塞的租房合同,球员需另寻住所

图片报:博阿滕解除奥利塞的租房合同,球员需另寻住所

懂球帝
2026-07-23 14:45:21
继父不好当啊!一名少年手持刀具,神情紧绷,一旁站着他恶狠狠的母亲,网友质问:多尔衮都搞不定的事,你一个普通人能搞定

继父不好当啊!一名少年手持刀具,神情紧绷,一旁站着他恶狠狠的母亲,网友质问:多尔衮都搞不定的事,你一个普通人能搞定

火山詩话
2026-07-23 08:11:25
coco彻底不装了!连爆张柏芝猛料,直言跟谢贤恋爱 是最大的烦恼

coco彻底不装了!连爆张柏芝猛料,直言跟谢贤恋爱 是最大的烦恼

闻识
2026-06-03 00:11:15
700Wh/kg固态电池问世,再也不怕冬天续航缩水!油车优势越来越小

700Wh/kg固态电池问世,再也不怕冬天续航缩水!油车优势越来越小

刘哥谈体育
2026-07-22 15:49:29
华春莹在东盟与中日韩(10+3)外长会上发表讲话

华春莹在东盟与中日韩(10+3)外长会上发表讲话

看看新闻Knews
2026-07-23 15:35:39
于东来连发6条动态,称“胖东来梦之城”将在三年内开业,并晒出多张效果图,还称:我从未想到像现在这样如此地爱自己

于东来连发6条动态,称“胖东来梦之城”将在三年内开业,并晒出多张效果图,还称:我从未想到像现在这样如此地爱自己

极目新闻
2026-07-23 16:47:29
泄露国乒机密、国外捞钱、更改国籍?樊振东究竟动了谁的“蛋糕”

泄露国乒机密、国外捞钱、更改国籍?樊振东究竟动了谁的“蛋糕”

猪小艳吖
2026-07-23 19:04:36
中国正式改口!以后不叫“日本政府”了,新称呼传递的信号不一般

中国正式改口!以后不叫“日本政府”了,新称呼传递的信号不一般

潘冹旅行浪子
2026-06-23 00:04:49
广东宏远完成大换血!朱芳雨离队,老队长回归,目标前四

广东宏远完成大换血!朱芳雨离队,老队长回归,目标前四

体坛瞎白话
2026-07-23 20:47:01
丰田官宣新车:9月3日,正式上市

丰田官宣新车:9月3日,正式上市

科技堡垒
2026-07-22 11:57:54
鲁比奥拒绝俄罗斯结束战争的提议,佩斯科夫称对谈判保持开放态度

鲁比奥拒绝俄罗斯结束战争的提议,佩斯科夫称对谈判保持开放态度

山河路口
2026-07-23 21:40:31
伊朗武装部队发言人:我们的导弹和无人机生产从未停止

伊朗武装部队发言人:我们的导弹和无人机生产从未停止

澎湃新闻
2026-07-23 17:44:11
日本,对中国称呼变了!

日本,对中国称呼变了!

戎评
2026-07-21 15:08:29
达成个人协议!4300万英镑,法国兽腰将签约曼联

达成个人协议!4300万英镑,法国兽腰将签约曼联

卡灵顿分析师
2026-07-23 18:37:38
2026-07-24 02:39:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9294文章数 567关注度
往期回顾 全部

科技要闻

中国数学家王虹、邓煜获菲尔兹奖

头条要闻

女副部王峻被处理:大搞权钱交易 泄露工作秘密

头条要闻

女副部王峻被处理:大搞权钱交易 泄露工作秘密

体育要闻

勇士24岁的MVP,也是个勒布朗?

娱乐要闻

梁朝伟汤唯19年后境遇反转

财经要闻

梁文锋当不成赛博圣人

汽车要闻

满配华为乾崑六件套 东风奕派M8限时权益价16.58万起

态度原创

家居
本地
健康
教育
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

跟着影视去旅行:西游篇

我是不是中风高风险人群?快速自测

教育要闻

高一高二英语不好的人,高三是怎么提起来的?分数买不来唯有努力

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版