网易首页 > 网易号 > 正文 申请入驻

机器人开始学会“三思而后行”?这家公司将世界模型接入灵巧操作,任务成功率提高至75%

0
分享至



机器人家务到底做得怎么样了,距离真正解放我们的双手还有多远?拧灯泡、撕厨房纸、抽出叠放纸杯,对人类轻而易举,但在具身智能领域,如何让机器稳定完成这些看似简单的操作,一直是个难题。

过去几年,机器人基础模型逐渐从针对单项任务训练,转向利用视觉、语言和动作数据学习通用策略。视觉语言动作模型(VLA)可以根据画面和指令输出动作,世界模型则尝试预测动作执行后环境将如何变化。

但如果机器人最终要进入工位、厨房和家庭,它需要追赶的或许不只是人类“完成动作”的能力。人类已经积累了海量与现实世界交互的经验,从怎么看物体、怎样用手,到接触失败后如何调整。如何让模型、训练数据和机器人本体都围绕这些经验共同演进,正在成为具身智能的一条重要路线。

9 月 10 日,生数科技联合创始人、首席执行官(CEO)骆怡航在 2026 外滩大会发布 Motus2。该模型由生数科技研究团队与清华大学共同完成,面向高自由度灵巧操作,已在采用 WUJI Hand 2、Sharpa Wave 等灵巧手的双臂机器人上测试。



Motus2 给出的技术路线,正可从人与模型、数据和硬件关系理解。它用共享模型连接动作生成、后果预测和价值评估,从约 13 万小时人类第一视角视频中提取操作先验,再用机器人轨迹完成本体适配。在执行端,双目视觉、工作记忆和触觉传感分别补充深度、历史与接触信息。

其核心变化,是让机器人在行动前“多想一步”,并把想象结果变成学习信号。前代 Motus 已联合建模视频与动作,Motus2 再加入价值模型,提出动作、预测后果并判断其是否接近目标。反馈既筛选当次动作,也用于更新策略。

给动作后果打分

如果想让机器人自主完成任务,那么首先需要回答一个问题:根据当前观测和任务指令,下一步应该执行什么动作。

工业机器人通常依赖预设轨迹、状态机或人工设计的规划器,在工位、物体位置和流程高度确定时稳定有效。一旦物体形态、摆放方式或任务指令发生变化,规则与轨迹往往需要重新设计。

近年来,模仿学习和视觉语言动作模型从示范数据中学习“观测—动作”映射,提高了任务泛化能力。但这类方法更擅长复现已有行为,通常缺少对动作后果及其任务价值的显式判断。

世界模型由此提供另一种思路。它不急于把动作送给真实机器人,而是根据当前观测和候选动作,先预测未来几帧环境可能发生什么变化。近年来,DreamDojo、Ctrl-World 等研究都在探索动作条件世界模型,机器人因此获得一个近似的内部模拟器。

此前,生数科技发布的 Motus 已在统一潜在动作世界模型中连接视频预测和动作生成。它既可作为世界动作模型(WAM),根据语言指令、当前观测和视觉历史生成动作,也可作为动作条件世界模型(AC-WM),在给定动作后预测未来视觉状态,分别回答“下一步做什么”和“执行后会发生什么”。

不过,“能想象未来”仍不等于“知道哪个未来更好”。机器人还需要依据人类设定的任务目标,在多个可能结果中判断哪一种更值得执行。

为此,Motus2 在这套结构中增加了价值模型(VM):类似人类在行动前权衡不同选择及其后果的思维,机器人需要根据动作及其结果评估任务进展,通过价值模型判断“这个结果是否更接近目标”。


图|Motus2 整体架构

但要让同一个模型兼顾动作、预测和评价,还必须确保三类信息按照真实行动顺序流动,不能让机器人在训练时“偷看答案”。

假如模型在生成动作时读取到了执行这个动作以后才出现的画面,相当于利用了现实部署时不存在的未来信息,训练结果则难以在实际部署中复现。

因此 Motus2 采用动作优先(Action-first)的信息流,让动作只读取此前信息,未来视频读取动作,价值评估再读取动作和预测结果,以保证动作生成过程符合真实部署时的因果顺序。

在此基础上,预测和评价结果进入两条路径。一条用于推理阶段的当次动作选择,另一条用于训练阶段的长期策略更新。

具体而言,在推理阶段,模型通过 Best-of-N 规划生成多个候选动作,分别预测其后果并评分,再选择较优方案执行。完成一个动作片段后,机器人重新获取真实环境中的观测,随后开始下一轮规划。这种方式仅改变本次动作选择,但不会更新参数。

第二种发生在训练阶段。Motus2 通过引入基于模型的强化学习(MBRL),可以将模拟器预测的未来和评估器给出的价值转化为策略更新信号:高价值方案得到更强引导,低价值动作逐渐减少。这意味着,世界模型预测出的未来不再只用于展示,也能反过来影响动作策略,使模型以后更容易生成有利于完成任务的方案。

另外,区别于主要依赖高质量成功示范进行行为克隆的训练方式,失败数据在此体系中也获得了新的用途。例如,经过筛选的成功示范可以直接监督动作学习;失败和次优轨迹虽然不适合作为模仿目标,却可以用于学习动作导致的环境变化,并为价值模型提供“哪些结果偏离任务目标”的判断依据,间接参与策略优化。

研究团队在放置手机和多指操作两项真机任务中,分别进行了每项 20 次闭环测试。基础策略的平均成功率为 65%,单独加入规划后达到 67.5%,单独加入 MBRL 后达到 72.5%,同时使用两种机制后达到 75%。

从对照结果看,推理时规划使成功率提高了 2.5 个百分点,MBRL 带来的提升为 7.5 个百分点。二者结合后较基础策略共提高 10 个百分点,说明在这两项任务中,更新策略产生的作用更明显,而规划可以在此基础上进一步改善当次动作选择。

如何学习 13 万小时的数据

在搭好了行动、预测和评价框架后,下一道门槛是数据。

灵巧手单手可有 20 个以上自由度,遥操作采集既需要设备、操作者和标定,也要承担磨损与安全成本。因此,如何获得足够丰富的操作数据,并将其扩展至不同任务和机器人本体,成为训练灵巧操作模型的一大难题。

目前,业内常见的数据扩展路径包括大规模机器人遥操作、仿真生成与从人类视频中提取先验。其中,机器人数据最接近部署本体,却昂贵且覆盖有限;仿真便于批量试错,但接触、材质和传感噪声与现实仍有差距。互联网或第一视角视频规模更大,却通常缺少可直接执行的机器人动作标签。

为缓解高质量机器人数据稀缺、不同数据源又难以直接对齐的问题,Motus2 采用了分层的数据扩展路径,先从人类第一视角视频中学习操作经验,再逐步迁移到机器人。

其数据体系包含约 13 万小时原始录像,训练依次使用单目视频、同步双目视频与人类动作,最后加入机器人轨迹和人机对应数据。


图|人类数据金字塔

论文披露的第一视角语料约 13 万小时,其中超过 11 万小时为单目数据,覆盖多种物体、场景和人类操作行为,帮助模型学习较广泛的视觉知识及状态变化。

第二阶段引入约 1.74 万小时同步双目素材。左右视角不仅增加画面数量,更提供视差形成的隐式深度线索,并支持更准确的三维手部姿态估计,使模型进一步学习手与物体之间较细粒度的空间关系。

不过,由于人手与灵巧手在关节数量、尺寸、活动范围和控制接口上并不一致,,若把人类姿态生硬映射到机器人关节,轻则动作变形,重则产生自碰撞或无法形成有效抓握。

为跨越这道“本体鸿沟”,Motus2 使用数十小时人机对齐数据,以及包含机器人轨迹在内、总计超过 100 小时的中间训练数据。此后,模型还要通过目标任务数据完成后训练,才能把人类操作经验转化为特定机器人可以执行的动作。

五项真机任务中,仅经人类数据预训练的模型平均成功率为 51%,加入机器人域中间训练后升至 84%。放置小球和贴合橡皮为 100%,拧灯泡 90%,多指操作 70%,放置手机 60%。人类视频提供操作先验,机器人数据仍负责动作落地。



此外,团队还用 2,000 至 20,000 小时双目数据比较人类动作预测误差。数据增加时,最优误差持续下降,并在测量范围内与数据时长的对数近似线性。但该指标是留出集上的人类动作预测,并非真机成功率,也不能推出扩张会无限保持同样收益。

因此,“以人为牵引”并不等于让机器人照搬人。更准确的说法是,先用人的视角和动作扩大模型对物理交互的认识,再用少量但更昂贵的对齐数据、机器人轨迹和目标任务数据逐级校正。数据路径要与模型接口匹配,而能否迁移又受到硬件形态约束,模型、数据与硬件在这里形成了相互制约的三角。

补全记忆与触觉

完成本体适配后,机器人仍不等于拥有人的操作能力。有些任务依赖已经发生的历史信息,另一些则取决于手指与物体间的实时接触,仅凭当前画面难以准确判断。

一般而言,业内会选择以扩大视觉上下文、压缩历史为记忆标记,或引入力觉和触觉传感来补足信息。但前者将面临历史完整度与计算量的取舍,后者则要处理采样频率、噪声、传感器形态和模型融合成本。

为此,Motus2 分别引入工作记忆与触觉专家,使机器人能够调用此前观测,并根据最新触觉反馈调整动作。

寻找隐藏方块时,机器人先要记住方块进入哪只杯子,再经历杯子移动和遮挡。固定滑动窗口开销不随任务时长增长,但早期线索会被逐出上下文。Motus2 比较了保留完整历史的全局自回归,以及把中间历史压缩成标记的混合记忆。

测试结果显示,在寻找隐藏方块和依据历史提示按键两项测试中,全局自回归在仿真环境中的平均成功率为 78%,混合记忆为 52%。转移到真机后,两者分别为 57.5% 和 25%。这意味着,在两项测试中,直接读取完整历史比压缩历史信息更有利于完成任务。

这些结果也反映出记忆方式需要在信息完整度与运行成本之间取舍。完整历史能够保留更多线索,也会增加上下文长度和计算开销。同时,真机成功率低于仿真结果,表明真实环境中的视觉变化、遮挡和执行误差仍会影响历史信息的调用。


图|Motus2 九项真机演示

触觉处理的是另一种不可见信息。抽取叠放纸杯时,夹得太松会滑落,太紧则可能带出下层纸杯。撕纸时,双手的受力位置和方向持续变化。摄像头通常要等物体发生明显位移后才能确认失误,指尖传感器却能更早捕捉接触力和形变。

若让完整策略模型随每次触觉更新重新推理,高频传感会带来延迟。因此,Motus2 沿用 T-Rex 的触觉响应思路,设置轻量触觉专家,主模型生成动作片段并缓存特征,每个短片段执行前,专家读取最新触觉,对尚未执行的动作作最后修正。

这一分工体现了模型与硬件的协同。主干负责较低频的全局语义和动作规划,触觉专家处理高频、局部的接触变化。训练时还预测动作后的真实力信号,帮助模型学习接触如何演化,部署时则只输出修正后的动作,避免每一步都重新运行大模型。

在抽取纸杯和撕纸两项任务中,加入触觉后平均成功率从 60% 升至 72.5%。其中抽取纸杯由 65% 升至 75%,撕纸由 55% 升至 70%。这组消融实验支持了触觉对精细接触操作的作用,但范围仍限于两项任务与特定平台,不能视作对所有材料和操作的普遍结论。

上述测试使用了单手 20 自由度的 WUJI Hand 2 和单手 22 自由度的 Sharpa Wave 等平台。


图|生数科技提出的通用世界模型五级演进路线

此外,生数科技还提出了通用世界模型(GWM)五级路线,以描述通用世界模型从生成环境走向自主行动的能力演进。五级路线依次为 L1“生成世界”、L2“与世界交互”、L3“在世界中行动”、L4“自主世界智能体”和 L5“世界组织者”。

按此框架,Motus2 已掌握 L3“在世界中行动”的关键能力:既能理解当前状态,也能预判行动后的未来,还能生成可执行的真实机器人动作。更进一步,它把 Evaluation 与 Feedback 明确接入闭环,形成“行动 → 预测 → 评估 → 反馈 → 再学习”的循环。

由此,这一机制初步展现出类似 RSI(Recursive Self-Improvement,递归自我改进)的特征:模型会借助自身对世界的预测和评估结果,反向优化行动策略。

世界模型开始拥有一定的自我演进能力,也是生数为从 L3 迈向 L4“自主世界智能体”的一次重要探索。

值得注意的是,Motus2 始终“以人为牵引”进行技术迭代,进一步印证了人类经验在机器人能力演进中的重要性。未来,若要继续迈向长期自主决策,仍需更可靠的预测、跨本体评测和规模化触觉采集,也取决于模型、数据与硬件能否协同演进。

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
迪拜航空安全事件更多细节披露:机上另两名飞行员控制飞机

迪拜航空安全事件更多细节披露:机上另两名飞行员控制飞机

北青网-北京青年报
2026-10-03 14:58:04
特朗普登上联合国大会讲台,抬手直指秘书长古特雷斯;中国6.85亿美元会费悄然到账

特朗普登上联合国大会讲台,抬手直指秘书长古特雷斯;中国6.85亿美元会费悄然到账

谈史论今1
2026-10-02 20:48:36
事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

人生录
2026-09-11 00:05:21
伊拉克宣布实现国家完全主权

伊拉克宣布实现国家完全主权

新华社
2026-10-01 20:28:10
中使馆:此案是国际社会前所未闻的恶性事件,日方如何处理,中方拭目以待

中使馆:此案是国际社会前所未闻的恶性事件,日方如何处理,中方拭目以待

南方都市报
2026-10-03 09:17:36
阿根廷推出“投资换国籍”计划:申请入籍者需要向阿根廷直接投资至少35万美元,且不可退还,或购买80万美元公共债券

阿根廷推出“投资换国籍”计划:申请入籍者需要向阿根廷直接投资至少35万美元,且不可退还,或购买80万美元公共债券

政知新媒体
2026-10-03 15:08:28
性感穿搭的我,能迷死万千少男吗?

性感穿搭的我,能迷死万千少男吗?

疾跑的小蜗牛
2026-10-03 16:58:53
肚子总是咕咕叫、放屁多?提醒:多半与6个原因有关,别不当回事

肚子总是咕咕叫、放屁多?提醒:多半与6个原因有关,别不当回事

王二哥老搞笑
2026-10-03 07:24:22
江苏富豪重金为痴傻儿子娶妻,拜金女孩欣然答应,新婚当晚却愣住

江苏富豪重金为痴傻儿子娶妻,拜金女孩欣然答应,新婚当晚却愣住

温情邮局
2025-07-09 14:39:26
因为“真有人用”,所以取消了所有福利?这波操作太真实了

因为“真有人用”,所以取消了所有福利?这波操作太真实了

夜深爱杂谈
2026-10-03 20:30:57
大瓜!裴小姐的老公,也出事了!

大瓜!裴小姐的老公,也出事了!

财经要参
2026-10-02 22:14:38
46岁高圆圆素颜穿塑料凉拖逛超市,被路人当成买菜大姐

46岁高圆圆素颜穿塑料凉拖逛超市,被路人当成买菜大姐

东方不败然多多
2026-10-01 20:30:13
最后一笔 100 亿美元汇出去了!孙正义,彻底把命押给了美国!

最后一笔 100 亿美元汇出去了!孙正义,彻底把命押给了美国!

荐史
2026-10-03 13:59:56
伊朗是脸不要了,还是底裤不要了!

伊朗是脸不要了,还是底裤不要了!

廖保平
2026-10-01 09:14:40
北美夺冠,海外票房破13.4亿!陈思诚国庆档冠军的对手来了?​

北美夺冠,海外票房破13.4亿!陈思诚国庆档冠军的对手来了?​

靠谱电影君
2026-10-03 21:06:24
舅舅宴请全家族唯独漏掉我爸妈,我停掉母亲副卡,结账时舅舅愣住

舅舅宴请全家族唯独漏掉我爸妈,我停掉母亲副卡,结账时舅舅愣住

观观说事
2026-10-03 14:30:06
进球后拇指朝下!巴勒斯坦王牌中文致歉:没有不尊重国足+中国人民

进球后拇指朝下!巴勒斯坦王牌中文致歉:没有不尊重国足+中国人民

我爱英超
2026-10-03 16:54:09
明日亚运看点:多项赛事迎来决战,中国军团全力冲刺奖牌

明日亚运看点:多项赛事迎来决战,中国军团全力冲刺奖牌

林子说事
2026-10-03 00:31:24
国足点球大战前:刘浩帆主动请缨,李昊称“最后怎么打都赢”

国足点球大战前:刘浩帆主动请缨,李昊称“最后怎么打都赢”

懂球帝
2026-10-03 18:03:15
没有退路!中国国防部已经向全世界亮明:解放军全员整装待发。

没有退路!中国国防部已经向全世界亮明:解放军全员整装待发。

小马姨
2026-09-25 20:41:19
2026-10-03 21:44:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17334文章数 515224关注度
往期回顾 全部

科技要闻

英伟达盘中创历史新高,市值逼近6万亿美元

头条要闻

媒体:韩国酵母的风 还是吹到了日本

头条要闻

媒体:韩国酵母的风 还是吹到了日本

体育要闻

这个讨论了一夏天的问题,马刺有答案了吗

娱乐要闻

马思纯一家爬山祈福!素颜出镜笑容甜

财经要闻

4亿台电视挂墙落灰 为何没人愿意开了?

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

艺术
时尚
旅游
手机
军事航空

艺术要闻

马岩松设计!上海“方舟”,实景和效果图有多像?

Chemena Kamali写给Chloé的又一封情书

旅游要闻

今天,20.97万人去了北京这里……听劝!这个时候来,游览更从容——

手机要闻

iPhone 18 Pro销量大涨!史上最贵却卖爆,有钱人真变多了?

军事要闻

美国被指正向中东派遣第三艘航母

无障碍浏览 进入关怀版