网易首页 > 网易号 > 正文 申请入驻

机器人不用真人教也能学新本事,靠的是自己给自己批改作业

0
分享至


你有没有想过一个问题:教机器人干活,为什么这么费钱?

答案很简单粗暴。你想让机器人学会一个新动作,比如把面包放进烤箱抽屉,通常得找个人穿戴动作捕捉设备,反复演示几十上百次,把这些"标准答案"喂给模型。这个过程叫专家示范采集,每次拓展一个新任务,就得重新来一遍这套流程,费时又费钱。

那能不能让机器人自己给自己出题、自己批改、自己进步呢?这正是EVO-WAM这篇论文想解决的问题。

世界动作模型:既会做梦,也会行动

要理解这篇论文的巧思,得先认识一个概念。

**世界动作模型**:简称WAM,是一类既能预测未来视频画面、又能同时生成对应机器人动作的AI模型。你可以把它想象成一个既会"做梦"又会"动手"的系统,输入当前的摄像头画面、机器人手臂的姿态、以及一句任务指令,比如"把杯子放到桌上",它会同时吐出两样东西:接下来几秒钟画面大概长什么样,以及要让机械臂真的做出这个动作,该怎么发指令。

这类模型的底气来自大规模视频预训练。互联网上有海量的人类操作物体的视频,模型看过这些视频后,对"物理世界大概怎么运作"有了一些直觉,即便是从没见过的任务,它也能连蒙带猜地想象出一个合理的完成过程。论文里提到的Cosmos3、DreamZero、LingBot-VA都是这类模型的代表。

但这里有个陷阱。

模型会做梦,不代表梦是对的。

同一个初始场景,同一句任务指令,世界动作模型可能这次生成的视频里任务成功了,下次生成的视频里任务失败了。更麻烦的是,即便视频画面看起来任务完成了,配套生成的那串动作指令也可能和画面对不上,真拿去执行会失败。这就好比一个学生写作业,答案页写着"正确",但演算过程其实是错的,你要是直接把这份作业当范本去学,只会越学越歪。

这就引出了论文的核心问题:一个世界动作模型,能不能从自己生成的一堆"梦"里,挑出真正靠谱的那些,拿来自我训练,从而在没见过的新任务上变得更强?

而且整个过程不允许作弊,不能在真实环境里试跑候选动作来验证对错,也不能额外收集专家示范。

三步循环:生成、验证、进化

EVO-WAM给出的答案是一个三步循环:生成、验证、改进。这个循环反复跑几轮,模型就在不断进步。

先说生成这一步。

要让模型自己"想象"出一整段完整的操作轨迹,必须解决一个技术难题。正常情况下,机器人每做一个动作,都会有摄像头拍下新画面、传感器读出新的关节角度,这些新信息会反过来告诉模型下一步该怎么走。但现在模型是在闭门造车,没有真实环境给反馈,它得自己预测出下一时刻的画面和机器人状态,再拿这个预测结果当作下一步的输入,一环套一环地往下生成。

论文管这个叫状态预测和锚定多帧上下文。

**状态预测**:训练模型不仅预测视频和动作,还要预测每个动作片段结束时机器人手臂应该处于什么姿态,这样才能给下一段生成提供起点。

**锚定多帧上下文**:生成过程中,始终保留任务刚开始时的第一帧画面作为参照锚点,同时结合最近几帧的画面提供动作趋势,两者搭配着喂给模型。

这个设计的必要性,从论文附录的一个实验能看得特别清楚。研究者对比了两种生成方式,一种去掉了这个锚点和多帧上下文,另一种保留。结果去掉锚点的那组,画面里一个黄色积木块被机械臂短暂挡住后,再也没出现过,凭空消失了。而保留锚点的那组,积木块在被挡住之后,机械臂移开,它又完好地出现在原地。

这就好比你在拼一幅长长的连环画,如果每一页只参考前一页,画着画着可能忘了开头出现过的道具,道具就悄悄从故事里消失了。但如果你手边始终留着第一页的原始草图当参照,不管画到第几页,你都能回头对一眼,确保关键元素没有走丢。锚点起的就是这个作用,它是整段自回归生成过程中唯一不会被遗忘的记忆锚点。

生成出候选轨迹之后,就进入验证环节,这是整篇论文最核心的设计。

两道关卡:VLM看画面,IDM查动作

**VLM**:视觉语言模型的缩写,一种既能看懂图片又能理解文字指令的AI模型,论文里用它来判断生成的视频是否真的完成了任务。

第一关是让VLM扮演考官。但这个考官的判卷方式很讲究,它不是看一眼画面就直接打分,而是拆成"描述"和"判断"两步。先让VLM老老实实描述画面里有哪些物体、它们的位置关系、机械臂现在处于什么状态,再拿这份描述去对照任务指令和当前应该完成的子目标,逐条核对是否达成:目标物体是否真的到位了、爪子是否松开了、其他物体有没有莫名其妙地变形、机械臂结构是否正常。四条全过,才算通过。

为什么要这么麻烦地拆成两步?因为直接让AI"看图打分"很容易被表面的视觉相似性骗过去,比如画面构图对了但物体其实穿模了、消失了。先描述再判断,相当于强迫AI把判断依据摆在明面上,减少想当然的误判。

光是VLM觉得画面对,还不够。

第二关是用一个叫IDM的模型来查动作是不是真的对得上画面。

**IDM**:逆动力学模型,一种反过来推理的AI,给它看一段视频里物体是怎么运动的,它能反推出"要让这个运动发生,机械臂当时的动作指令应该是什么样"。

论文的做法是,拿世界动作模型自己生成的动作,和IDM根据同一段生成视频反推出来的动作做对比,如果两者差得太多,说明这段视频和动作对不上,画面里演的是一出戏,配的动作却是另一套剧本,这种轨迹会被直接淘汰。

论文里有个案例特别说明问题。任务是把一个蓝色订书机放到秤上,生成的视频里订书机确实被移到了秤上,VLM一看,通过。但把这套动作真的拿到仿真环境里跑一遍,机械臂压根没抓住订书机,订书机全程待在桌子上没挪窝,秤上空空如也。IDM计算出的动作误差是0.00632283,超过了设定的阈值0.00418487,这条轨迹被拦了下来。

这个例子挺扎心的,因为如果只靠VLM把关,这条错误轨迹会被当成正确范本混进训练数据里,模型学的其实是"生成一段看起来对的视频,配上一套其实抓不住东西的动作",越学越像纸上谈兵的学生。

这就像开车考试,教练光看你有没有把车停进车位是不够的,还得看你打方向盘、踩刹车的整个操作序列是不是合乎逻辑地导向了这个停车结果。如果你是闭着眼睛瞎蒙,凑巧车停正了,这次侥幸不该被记作"学会了",下次遇到稍微不同的车位就会露馅。IDM干的正是这个"回放操作过程、核实动作逻辑"的活。

论文附录里还专门做了一次可靠性检验,拿700条生成轨迹去对照仿真器里真实执行的结果。只用VLM把关,准确率是68%,加上IDM之后,准确率提升到86%,误判率从12.8%降到3%。这组数字挺直观地说明了双重验证比单一验证靠谱得多。

通过两关验证的轨迹片段,才会进入训练池,累积到一定规模后用于监督微调,更新出新一轮的模型,这个新模型再去生成下一批候选轨迹,循环往复。论文里管这个叫迭代自训练。

**监督微调**:用一批已经确认质量的数据继续训练一个已有模型,让它在原有基础上学习新知识,同时尽量不忘记原来会的东西。

数字说话:提升有多大

理论说得再漂亮,最后还得看效果。

论文在RoboTwin 2.0仿真平台上做了测试,用43个任务训练基础模型,剩下7个模型完全没见过的任务用来做自我进化和评估。结果很直接:Cosmos3这个骨干模型,原本在这7个陌生任务上的平均成功率只有26.9%,经过四轮自我进化后,飙升到68.0%,差不多是原来的2.5倍。换成DreamZero骨干,成功率从28.5%涨到46.4%,大约1.6倍。

拆开来看每个任务的表现更有意思。比如"把三个积木摞起来"这个任务,原本成功率只有1.5%,几乎不会做,进化四轮后涨到35.5%。"把物体放到秤上"从28%涨到78%。这种跨度不是小修小补,是从几乎不会做到能做对大半的量级跃升。

真实机器人上的测试更能说明问题,因为仿真环境毕竟和现实有差距。论文找了一台Franka机械臂,设计了三个长程复合任务:把粉色碗叠到蓝色碗上再一起叠到白色碗上、把两只颜色不同的玩具鸭分别放进对应颜色的碗里、打开烤箱抽屉再把面包放进去。这些任务的共同特点是需要多步骤按顺序完成,前一步没做对,后面全乱套。

结果Cosmos3骨干模型原本平均成功率只有20%,进化后达到76.7%,提升了56.7个百分点。在"打开抽屉再放面包"这个任务上,提升尤其夸张,从10%涨到90%。

这里有个细节值得琢磨。论文观察到,进化过程中大部分的提升发生在第一轮,从26.9%直接跳到58.3%,后面几轮涨幅逐渐放缓,甚至第三轮还出现过短暂的回落。这说明模型自己生成的那些"梦"里,最容易挖到的有效经验往往一开始就能挖到,后面越往后收益递减,这和很多自我学习系统的规律是一致的,边际效用递减几乎是这类方法的通病。

论文还做了一个很实在的对比实验,来证明这套双重验证机制不是花架子。研究者设置了三种验证方式做对照:只用VLM检查画面、VLM加IDM双重检查、以及用仿真器直接跑一遍动作看是否真成功。结果只用VLM把关的那组,四轮下来成功率只到43.7%,而VLM加IDM那组能到68.0%,差了24个百分点还多。这个差距直接证明了,光看画面是不够的,必须核实动作和画面是不是真的自洽。

用仿真器直接验证效果最好,能到72.7%,但这个办法有个硬伤,它得依赖一个能精确复刻目标任务和场景的仿真器,现实世界里很多任务根本没法仿真,而IDM不需要这个前提,直接从视频里反推动作,更容易推广到真实机器人场景。

论文也测试了换一个更小、更便宜的语言模型来做视觉判断会怎样。用参数量小得多的Qwen3.5-27B替换掉原本更强大的Qwen3.8-Flash-Next,成功率从68.0%略降到65.7%,降幅不算大。这说明这套方法对验证模型的选择没有那么挑剔,便宜的模型也能撑起大部分效果,这对实际部署来说是个好消息,意味着不需要非用最贵的模型才能跑通这套系统。

新场景泛化和旧本领保留

一个自然的疑问是,模型是不是只是把训练时见过的那几个场景死记硬背下来了,换个新摆法就露馅?

论文专门测试了这一点,随机抽取了100个全新的场景配置,模型没在这些具体场景上做过自我训练,直接拿去测。结果EVO-WAM版本的Cosmos3在新场景上达到70.4%的成功率,而原始基线模型只有24.9%。这个结果说明,模型学到的不只是特定场景的固定套路,而是具备了一定的迁移能力,能把学到的操作逻辑用到没见过的具体摆放方式上。

另一个疑问是,既然模型花了大量精力学新任务,会不会把原本就会的旧任务忘掉?这是持续学习领域一个经典的老大难问题,叫灾难性遗忘。

论文测试了43个基础训练任务,原始Cosmos3基线的成功率是85.8%,进化四轮之后的模型是84.8%,只掉了1个百分点。这个结果说明,论文里训练数据混合的策略,把新验证过的数据和原始训练数据按比例搭配,再加上历史轮次的数据一直保留在训练池里参与后续训练,有效地防止了模型学新忘旧。

写在后面

读完这篇论文,最让我意外的其实不是成功率数字本身,而是那个订书机的案例。

一条视频画面明明"看起来"任务已经完成了,配套的动作却压根没做到,这种视觉和动作脱节的现象,单靠人眼盯着视频看是很难察觉的,因为你看的是渲染出来的结果画面,而不是背后驱动这个结果的动作序列本身。这提醒我一件事:在评价任何一个能同时生成"计划"和"执行方案"的AI系统时,光看计划好不好看是远远不够的,得追问这套计划背后配的执行细节是不是真的能落地。这个道理其实超出了机器人领域,放到很多需要"想"和"做"两套系统协同的场景里都成立。

另一个让我反复琢磨的细节是,提升幅度在第一轮进化里最猛,后面逐渐放缓甚至偶尔回落。这多少说明了一件事:自我学习这条路,不是轮数越多越好,存在某种边际收益递减,甚至过犹不及的临界点。至于这个临界点背后是什么机制在起作用,是训练数据的多样性触顶了,还是模型自身的表达能力遇到了瓶颈,论文没有深挖,这大概是留给后续研究者的一道题。

如果机器人真能靠自己生成的经验不断进化,那接下来会不会出现这样一种可能:一个机器人在深夜独自运转,一遍遍地想象、验证、修正自己的动作,第二天早上就学会了一个昨天还完全不会的新本事?

Q&A

Q1:EVO-WAM是什么?

A:EVO-WAM是一个让世界动作模型在没有新增专家示范、不在真实环境试跑动作的前提下,通过自己生成视频动作轨迹并验证其可靠性,来提升在陌生任务上表现的框架,核心是生成、验证、改进的循环。

Q2:EVO-WAM为什么要同时用VLM和IDM两道验证关卡?

A:因为单靠VLM看画面容易被视觉表面骗过去,视频看着任务完成了但配套动作其实执行不了,加上IDM反推动作核实一致性后,自我训练的效果提升明显,论文实验显示仅用VLM四轮后成功率是43.7%,加上IDM能到68.0%。

Q3:EVO-WAM的效果提升有多大?

A:在RoboTwin 2.0仿真平台的七个陌生任务上,Cosmos3骨干模型平均成功率从26.9%提升到68.0%,DreamZero从28.5%提升到46.4%;真实机器人长程复合任务上,Cosmos3平均成功率从20.0%提升到76.7%。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
韩国教授坦言:放眼全球,唯独韩国瞧不起中国;而在中国人眼里,压根没有韩国的位置

韩国教授坦言:放眼全球,唯独韩国瞧不起中国;而在中国人眼里,压根没有韩国的位置

z千年历史老号
2026-10-08 17:02:34
李四川参加竞选活动,舞台突然塌陷,主持人喊:压倒性胜利

李四川参加竞选活动,舞台突然塌陷,主持人喊:压倒性胜利

金牛传声
2026-10-09 22:06:14
飞天奖获奖:宋佳成首位一串三大满贯视后!王仁君爆冷夺视帝,赵丽颖恭喜

飞天奖获奖:宋佳成首位一串三大满贯视后!王仁君爆冷夺视帝,赵丽颖恭喜

露珠聊影视
2026-10-09 23:29:01
商务部:中欧双方以符合世贸组织规则的方式就混动汽车贸易达成谅解

商务部:中欧双方以符合世贸组织规则的方式就混动汽车贸易达成谅解

IT之家
2026-10-09 22:06:10
成都沦为川西“超级服务区”?740万人来了就走,钱一分没留下

成都沦为川西“超级服务区”?740万人来了就走,钱一分没留下

就像当初啊
2026-10-09 02:38:24
教育大局定了:若是不出意外的话,2027年中国义务教育迎3大变化

教育大局定了:若是不出意外的话,2027年中国义务教育迎3大变化

户外阿毽
2026-10-05 02:16:45
维斯塔潘夺杆位却遭调查:黄旗超车那一刻他立刻喊了无线电

维斯塔潘夺杆位却遭调查:黄旗超车那一刻他立刻喊了无线电

赛场速报局
2026-10-09 21:51:32
为何韩国改名首尔,全世界却只要求中国更改叫法,背后有何隐情

为何韩国改名首尔,全世界却只要求中国更改叫法,背后有何隐情

游文刀
2026-10-06 00:31:14
俄罗斯被曝出现第二例不明肺炎!距离发源地2300公里

俄罗斯被曝出现第二例不明肺炎!距离发源地2300公里

项鹏飞
2026-10-08 20:02:28
遗憾!U18女篮无缘决赛,李沅珊23中7,孙瑞阳9中1,陈楠用人遭质疑

遗憾!U18女篮无缘决赛,李沅珊23中7,孙瑞阳9中1,陈楠用人遭质疑

萌兰聊个球
2026-10-09 21:17:10
中国队1胜4负!烂柯杯中韩战又遭惨败 韩国占据八强五席中方3席

中国队1胜4负!烂柯杯中韩战又遭惨败 韩国占据八强五席中方3席

劲爆体坛
2026-10-09 18:43:05
胡兆民任赤峰市委副书记、市政府党组书记 此前担任内蒙古交投集团董事长

胡兆民任赤峰市委副书记、市政府党组书记 此前担任内蒙古交投集团董事长

中国经济网
2026-10-09 14:30:15
穆里尼奥铁腕清洗!皇马两大王牌上离队名单!冬窗直接送走

穆里尼奥铁腕清洗!皇马两大王牌上离队名单!冬窗直接送走

奶盖熊本熊
2026-10-09 07:58:56
74-68逆转广东!山东开门红难言开心,王岚钦10+4,徐杰离谱8中1

74-68逆转广东!山东开门红难言开心,王岚钦10+4,徐杰离谱8中1

萌兰聊个球
2026-10-09 21:29:54
台湾和上海都是 2000 多万人口,上半年台湾 GDP3.48 万亿,上海多少

台湾和上海都是 2000 多万人口,上半年台湾 GDP3.48 万亿,上海多少

抽象派大师
2026-09-20 16:57:21
太难了!广东新外援首秀5中0只拿1分+萨姆纳骨折,主帅无人可用

太难了!广东新外援首秀5中0只拿1分+萨姆纳骨折,主帅无人可用

林小湜体育频道
2026-10-10 00:06:49
出兵即侵略!中方亮明底线:敢派兵台海,本土将成合法打击目标

出兵即侵略!中方亮明底线:敢派兵台海,本土将成合法打击目标

李健政观察
2026-08-18 14:45:30
欧洲坚持要在2027年停用俄罗斯,中国将成俄罗斯天然气唯一大买家

欧洲坚持要在2027年停用俄罗斯,中国将成俄罗斯天然气唯一大买家

抽象派大师
2026-10-09 00:22:43
我工资9000,发工资时却到账49000,去找老板问,老板却反问:前晚发的通知,你没看?

我工资9000,发工资时却到账49000,去找老板问,老板却反问:前晚发的通知,你没看?

LULU生活家
2026-10-09 16:27:21
局势彻底变天了!中日对峙一天天拖下去,越来越多国家终于意识到:中日若兵戎相见,不会像俄乌冲突那样给第三方牟利的机会,而是一场血战

局势彻底变天了!中日对峙一天天拖下去,越来越多国家终于意识到:中日若兵戎相见,不会像俄乌冲突那样给第三方牟利的机会,而是一场血战

林杰论事
2026-10-03 02:28:50
2026-10-10 03:27:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
10075文章数 570关注度
往期回顾 全部

科技要闻

华为小米手机同日涨价,最高涨1000元

头条要闻

七旬大伯在浙江买山景别墅养老 住进去后天天提心吊胆

头条要闻

七旬大伯在浙江买山景别墅养老 住进去后天天提心吊胆

体育要闻

与C罗硬碰硬,一个72岁老人的倔强

娱乐要闻

吴奇隆宣布重要决定,走上谢霆锋老路

财经要闻

时隔12年,公募基金运作办法修订

汽车要闻

2027款深蓝L06及追风版上市 限时权益价11.49万元起

态度原创

家居
教育
健康
公开课
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

深圳中小学的春秋假来啦,你开心吗?

痘坑留下后,还能填平吗?

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

直击南部战区海军某部重装空投训练

无障碍浏览 进入关怀版