![]()
你有没有想过一个问题:教机器人干活,为什么这么费钱?
答案很简单粗暴。你想让机器人学会一个新动作,比如把面包放进烤箱抽屉,通常得找个人穿戴动作捕捉设备,反复演示几十上百次,把这些"标准答案"喂给模型。这个过程叫专家示范采集,每次拓展一个新任务,就得重新来一遍这套流程,费时又费钱。
那能不能让机器人自己给自己出题、自己批改、自己进步呢?这正是EVO-WAM这篇论文想解决的问题。
世界动作模型:既会做梦,也会行动
要理解这篇论文的巧思,得先认识一个概念。
**世界动作模型**:简称WAM,是一类既能预测未来视频画面、又能同时生成对应机器人动作的AI模型。你可以把它想象成一个既会"做梦"又会"动手"的系统,输入当前的摄像头画面、机器人手臂的姿态、以及一句任务指令,比如"把杯子放到桌上",它会同时吐出两样东西:接下来几秒钟画面大概长什么样,以及要让机械臂真的做出这个动作,该怎么发指令。
这类模型的底气来自大规模视频预训练。互联网上有海量的人类操作物体的视频,模型看过这些视频后,对"物理世界大概怎么运作"有了一些直觉,即便是从没见过的任务,它也能连蒙带猜地想象出一个合理的完成过程。论文里提到的Cosmos3、DreamZero、LingBot-VA都是这类模型的代表。
但这里有个陷阱。
模型会做梦,不代表梦是对的。
同一个初始场景,同一句任务指令,世界动作模型可能这次生成的视频里任务成功了,下次生成的视频里任务失败了。更麻烦的是,即便视频画面看起来任务完成了,配套生成的那串动作指令也可能和画面对不上,真拿去执行会失败。这就好比一个学生写作业,答案页写着"正确",但演算过程其实是错的,你要是直接把这份作业当范本去学,只会越学越歪。
这就引出了论文的核心问题:一个世界动作模型,能不能从自己生成的一堆"梦"里,挑出真正靠谱的那些,拿来自我训练,从而在没见过的新任务上变得更强?
而且整个过程不允许作弊,不能在真实环境里试跑候选动作来验证对错,也不能额外收集专家示范。
三步循环:生成、验证、进化
EVO-WAM给出的答案是一个三步循环:生成、验证、改进。这个循环反复跑几轮,模型就在不断进步。
先说生成这一步。
要让模型自己"想象"出一整段完整的操作轨迹,必须解决一个技术难题。正常情况下,机器人每做一个动作,都会有摄像头拍下新画面、传感器读出新的关节角度,这些新信息会反过来告诉模型下一步该怎么走。但现在模型是在闭门造车,没有真实环境给反馈,它得自己预测出下一时刻的画面和机器人状态,再拿这个预测结果当作下一步的输入,一环套一环地往下生成。
论文管这个叫状态预测和锚定多帧上下文。
**状态预测**:训练模型不仅预测视频和动作,还要预测每个动作片段结束时机器人手臂应该处于什么姿态,这样才能给下一段生成提供起点。
**锚定多帧上下文**:生成过程中,始终保留任务刚开始时的第一帧画面作为参照锚点,同时结合最近几帧的画面提供动作趋势,两者搭配着喂给模型。
这个设计的必要性,从论文附录的一个实验能看得特别清楚。研究者对比了两种生成方式,一种去掉了这个锚点和多帧上下文,另一种保留。结果去掉锚点的那组,画面里一个黄色积木块被机械臂短暂挡住后,再也没出现过,凭空消失了。而保留锚点的那组,积木块在被挡住之后,机械臂移开,它又完好地出现在原地。
这就好比你在拼一幅长长的连环画,如果每一页只参考前一页,画着画着可能忘了开头出现过的道具,道具就悄悄从故事里消失了。但如果你手边始终留着第一页的原始草图当参照,不管画到第几页,你都能回头对一眼,确保关键元素没有走丢。锚点起的就是这个作用,它是整段自回归生成过程中唯一不会被遗忘的记忆锚点。
生成出候选轨迹之后,就进入验证环节,这是整篇论文最核心的设计。
两道关卡:VLM看画面,IDM查动作
**VLM**:视觉语言模型的缩写,一种既能看懂图片又能理解文字指令的AI模型,论文里用它来判断生成的视频是否真的完成了任务。
第一关是让VLM扮演考官。但这个考官的判卷方式很讲究,它不是看一眼画面就直接打分,而是拆成"描述"和"判断"两步。先让VLM老老实实描述画面里有哪些物体、它们的位置关系、机械臂现在处于什么状态,再拿这份描述去对照任务指令和当前应该完成的子目标,逐条核对是否达成:目标物体是否真的到位了、爪子是否松开了、其他物体有没有莫名其妙地变形、机械臂结构是否正常。四条全过,才算通过。
为什么要这么麻烦地拆成两步?因为直接让AI"看图打分"很容易被表面的视觉相似性骗过去,比如画面构图对了但物体其实穿模了、消失了。先描述再判断,相当于强迫AI把判断依据摆在明面上,减少想当然的误判。
光是VLM觉得画面对,还不够。
第二关是用一个叫IDM的模型来查动作是不是真的对得上画面。
**IDM**:逆动力学模型,一种反过来推理的AI,给它看一段视频里物体是怎么运动的,它能反推出"要让这个运动发生,机械臂当时的动作指令应该是什么样"。
论文的做法是,拿世界动作模型自己生成的动作,和IDM根据同一段生成视频反推出来的动作做对比,如果两者差得太多,说明这段视频和动作对不上,画面里演的是一出戏,配的动作却是另一套剧本,这种轨迹会被直接淘汰。
论文里有个案例特别说明问题。任务是把一个蓝色订书机放到秤上,生成的视频里订书机确实被移到了秤上,VLM一看,通过。但把这套动作真的拿到仿真环境里跑一遍,机械臂压根没抓住订书机,订书机全程待在桌子上没挪窝,秤上空空如也。IDM计算出的动作误差是0.00632283,超过了设定的阈值0.00418487,这条轨迹被拦了下来。
这个例子挺扎心的,因为如果只靠VLM把关,这条错误轨迹会被当成正确范本混进训练数据里,模型学的其实是"生成一段看起来对的视频,配上一套其实抓不住东西的动作",越学越像纸上谈兵的学生。
这就像开车考试,教练光看你有没有把车停进车位是不够的,还得看你打方向盘、踩刹车的整个操作序列是不是合乎逻辑地导向了这个停车结果。如果你是闭着眼睛瞎蒙,凑巧车停正了,这次侥幸不该被记作"学会了",下次遇到稍微不同的车位就会露馅。IDM干的正是这个"回放操作过程、核实动作逻辑"的活。
论文附录里还专门做了一次可靠性检验,拿700条生成轨迹去对照仿真器里真实执行的结果。只用VLM把关,准确率是68%,加上IDM之后,准确率提升到86%,误判率从12.8%降到3%。这组数字挺直观地说明了双重验证比单一验证靠谱得多。
通过两关验证的轨迹片段,才会进入训练池,累积到一定规模后用于监督微调,更新出新一轮的模型,这个新模型再去生成下一批候选轨迹,循环往复。论文里管这个叫迭代自训练。
**监督微调**:用一批已经确认质量的数据继续训练一个已有模型,让它在原有基础上学习新知识,同时尽量不忘记原来会的东西。
数字说话:提升有多大
理论说得再漂亮,最后还得看效果。
论文在RoboTwin 2.0仿真平台上做了测试,用43个任务训练基础模型,剩下7个模型完全没见过的任务用来做自我进化和评估。结果很直接:Cosmos3这个骨干模型,原本在这7个陌生任务上的平均成功率只有26.9%,经过四轮自我进化后,飙升到68.0%,差不多是原来的2.5倍。换成DreamZero骨干,成功率从28.5%涨到46.4%,大约1.6倍。
拆开来看每个任务的表现更有意思。比如"把三个积木摞起来"这个任务,原本成功率只有1.5%,几乎不会做,进化四轮后涨到35.5%。"把物体放到秤上"从28%涨到78%。这种跨度不是小修小补,是从几乎不会做到能做对大半的量级跃升。
真实机器人上的测试更能说明问题,因为仿真环境毕竟和现实有差距。论文找了一台Franka机械臂,设计了三个长程复合任务:把粉色碗叠到蓝色碗上再一起叠到白色碗上、把两只颜色不同的玩具鸭分别放进对应颜色的碗里、打开烤箱抽屉再把面包放进去。这些任务的共同特点是需要多步骤按顺序完成,前一步没做对,后面全乱套。
结果Cosmos3骨干模型原本平均成功率只有20%,进化后达到76.7%,提升了56.7个百分点。在"打开抽屉再放面包"这个任务上,提升尤其夸张,从10%涨到90%。
这里有个细节值得琢磨。论文观察到,进化过程中大部分的提升发生在第一轮,从26.9%直接跳到58.3%,后面几轮涨幅逐渐放缓,甚至第三轮还出现过短暂的回落。这说明模型自己生成的那些"梦"里,最容易挖到的有效经验往往一开始就能挖到,后面越往后收益递减,这和很多自我学习系统的规律是一致的,边际效用递减几乎是这类方法的通病。
论文还做了一个很实在的对比实验,来证明这套双重验证机制不是花架子。研究者设置了三种验证方式做对照:只用VLM检查画面、VLM加IDM双重检查、以及用仿真器直接跑一遍动作看是否真成功。结果只用VLM把关的那组,四轮下来成功率只到43.7%,而VLM加IDM那组能到68.0%,差了24个百分点还多。这个差距直接证明了,光看画面是不够的,必须核实动作和画面是不是真的自洽。
用仿真器直接验证效果最好,能到72.7%,但这个办法有个硬伤,它得依赖一个能精确复刻目标任务和场景的仿真器,现实世界里很多任务根本没法仿真,而IDM不需要这个前提,直接从视频里反推动作,更容易推广到真实机器人场景。
论文也测试了换一个更小、更便宜的语言模型来做视觉判断会怎样。用参数量小得多的Qwen3.5-27B替换掉原本更强大的Qwen3.8-Flash-Next,成功率从68.0%略降到65.7%,降幅不算大。这说明这套方法对验证模型的选择没有那么挑剔,便宜的模型也能撑起大部分效果,这对实际部署来说是个好消息,意味着不需要非用最贵的模型才能跑通这套系统。
新场景泛化和旧本领保留
一个自然的疑问是,模型是不是只是把训练时见过的那几个场景死记硬背下来了,换个新摆法就露馅?
论文专门测试了这一点,随机抽取了100个全新的场景配置,模型没在这些具体场景上做过自我训练,直接拿去测。结果EVO-WAM版本的Cosmos3在新场景上达到70.4%的成功率,而原始基线模型只有24.9%。这个结果说明,模型学到的不只是特定场景的固定套路,而是具备了一定的迁移能力,能把学到的操作逻辑用到没见过的具体摆放方式上。
另一个疑问是,既然模型花了大量精力学新任务,会不会把原本就会的旧任务忘掉?这是持续学习领域一个经典的老大难问题,叫灾难性遗忘。
论文测试了43个基础训练任务,原始Cosmos3基线的成功率是85.8%,进化四轮之后的模型是84.8%,只掉了1个百分点。这个结果说明,论文里训练数据混合的策略,把新验证过的数据和原始训练数据按比例搭配,再加上历史轮次的数据一直保留在训练池里参与后续训练,有效地防止了模型学新忘旧。
写在后面
读完这篇论文,最让我意外的其实不是成功率数字本身,而是那个订书机的案例。
一条视频画面明明"看起来"任务已经完成了,配套的动作却压根没做到,这种视觉和动作脱节的现象,单靠人眼盯着视频看是很难察觉的,因为你看的是渲染出来的结果画面,而不是背后驱动这个结果的动作序列本身。这提醒我一件事:在评价任何一个能同时生成"计划"和"执行方案"的AI系统时,光看计划好不好看是远远不够的,得追问这套计划背后配的执行细节是不是真的能落地。这个道理其实超出了机器人领域,放到很多需要"想"和"做"两套系统协同的场景里都成立。
另一个让我反复琢磨的细节是,提升幅度在第一轮进化里最猛,后面逐渐放缓甚至偶尔回落。这多少说明了一件事:自我学习这条路,不是轮数越多越好,存在某种边际收益递减,甚至过犹不及的临界点。至于这个临界点背后是什么机制在起作用,是训练数据的多样性触顶了,还是模型自身的表达能力遇到了瓶颈,论文没有深挖,这大概是留给后续研究者的一道题。
如果机器人真能靠自己生成的经验不断进化,那接下来会不会出现这样一种可能:一个机器人在深夜独自运转,一遍遍地想象、验证、修正自己的动作,第二天早上就学会了一个昨天还完全不会的新本事?
Q&A
Q1:EVO-WAM是什么?
A:EVO-WAM是一个让世界动作模型在没有新增专家示范、不在真实环境试跑动作的前提下,通过自己生成视频动作轨迹并验证其可靠性,来提升在陌生任务上表现的框架,核心是生成、验证、改进的循环。
Q2:EVO-WAM为什么要同时用VLM和IDM两道验证关卡?
A:因为单靠VLM看画面容易被视觉表面骗过去,视频看着任务完成了但配套动作其实执行不了,加上IDM反推动作核实一致性后,自我训练的效果提升明显,论文实验显示仅用VLM四轮后成功率是43.7%,加上IDM能到68.0%。
Q3:EVO-WAM的效果提升有多大?
A:在RoboTwin 2.0仿真平台的七个陌生任务上,Cosmos3骨干模型平均成功率从26.9%提升到68.0%,DreamZero从28.5%提升到46.4%;真实机器人长程复合任务上,Cosmos3平均成功率从20.0%提升到76.7%。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.