![]()
![]()
不使用“外挂”最强世界动作模型VPP2拿下RoboDojo榜首
近日,星动纪元世界动作模型(WAM)VPP2(Video Prediction Policy ),以平均成功率(Avg SR)32.26%、平均得分(Avg Score)39.26分的成绩登顶 “具身智能界的珠穆朗玛峰”RoboDojo榜首,并拿下泛化能力(Generalization)、精细操作(Precision)、记忆能力(Memory)三项成绩第一。超越GPT-6 Astra、Physical Intelligence π0.5、英伟达GR00T-N1.7等模型。
更关键的是,VPP2未使用任何额外数据或Agent RSI,仅仅使用标准数据集就斩获了榜首,更加体现了VPP2模型本身的优越性——性能提升来自预训练,不靠外挂增强策略,不靠扩充数据“刷分”。
“具身智能界的珠穆朗玛峰”RoboDojo
关于Robodojo榜单:RoboDojo是由香港大学MMLab牵头、全球近20所顶尖学术机构共建的具身智能统一评测基准,以“仿真+真机”全科大考和极致难度著称,被业界称为“具身智能界的珠穆朗玛峰”。它的价值不在于再造一个Benchmark,而在于为整个行业立下一把统一、可复现的标尺——让“看起来很厉害”变成“分数上见真章”,推动具身智能从Demo驱动走向可量化、可比较的工程化竞争。
如何训练最强世界动作模型 (WAM)
1.VPP2的起始:如何让WAM在开放环境下泛化?
机器人学习领域最主流的范式之一,是“世界动作模型”(World Action Models, WAM):把视频生成模型“预测未来画面”的能力,迁移为机器人“该怎么动”的动作能力。直觉上很美好——一个能在脑海中推演未来的机器人,理应知道下一步该做什么。
然而,实际情况是,几乎所有过往WAM的工作里根本没有任何开放环境的视频预测,都只能放出在特定领域过拟合的视频预测。一旦放到开放式环境中,WAM就经常预测出错误的运动,进而输出错误的动作。
让WAM泛化性丢失的主要有下面两点原因:
第一道坎:视频底座不是为 "操作" 而生:基础视频模型主要面向创意内容生成与美学质量优化,充满想象力,因此往往难以准确遵循细致的操作指令。
第二道坎:后训练硬塞动作,反而让模型 "变笨" :向预训练视频底座中引入动作专用组件或联合训练目标,会显著削弱其原有泛化能力——模型记住了几个特定动作,却丧失了对千变万化场景的适应力。VPP2的核心目标,就是保留视频模型的泛化性的前提下,加入action动作建模。
2.VPP2:视频预测和动作生成都能泛化的WAM
VPP2的最大特点是在视频预测和动作生成两方面都具备强零样本泛化能力。视频预测的质量,决定了动作的上限。因此正确的顺序不是"视频、动作一锅炖",而是把两者解耦、排序。
![]()
先用海量、多样、坐标系统一的数据,把视频模型训练成一个真正可泛化的“未来预测器”;再分阶段、有节制地把动作能力“嫁接”上去。整套方法因此建立在两大工程之上——一个统一的数据底座和一条三阶段训练流水线。
![]()
图注:图中是左上是大规模多样化操作数据;三组柱状图分别展示三大成果——(1)视频预测指令遵循、(2)零样本真实世界操作、(3)基准后训练成绩。下方则对比了两种范式:"简单描述→短未来片段"会产生不稳定、多峰的错误映射,而"详细描述→完整轨迹"能得到唯一、稳定的映射与集中的分布。这张图直接回答了"为什么要用详细描述、为什么要分阶段"。
图中下半部分尤其关键:输入给模型的描述质量,决定了它学到的是"虚假相关"还是"任务因果"。一句简单的"把碗放进箱子",模型只能在画面里做概率猜测,映射关系飘忽不定(Unstable mapping、Multiple modes);而一段详细描述——"左侧夹爪拿起左侧白碗、放入透明箱、摄像机视角保持静止"——则把模型锁定到唯一、稳定的因果轨迹上(Unique, stable mapping)。
3.VPP2能泛化的【关键点-1】:优秀的数据处理管线
① 数据处理流水线:过滤→分割→详细描述
泛化能力跃升一半来自训练策略,另一半来自看似枯燥的数据工程。星动纪元首先构建了一个覆盖五类来源的大规模操作数据集,并对不同类型采用不同的过滤策略,以兼顾多样性与质量。原始视频进入训练前,要经过一条严格的处理流水线,核心目标是降低未来预测的不确定性:
过滤——只保留末端执行器可见的片段;
分割——按任务边界把长视频切成片段,并由视觉语言模型(VLM)合并相邻片段、微调起止点;
描述生成——VLM 为每个片段生成包含任务说明、活动末端执行器、无歧义目标物体、摄像机视角四要素的详细描述。
![]()
图注:上排展示过滤规则——末端执行器不可见的片段直接删除;末端执行器完全可见的帧作为首帧;并明确指定目标物体(“指定左侧的杯子,桌上有两个杯子”“指定最左侧的黄色盒子,桌上有三个盒子”)。左下是多视角拼接;中间是描述模板(左/右夹爪、指定物体、摄像机视角等字段);右下是按模板生成的最终描述。每条描述都包含详细任务说明、末端执行器标识、可见目标物体与摄像机视角,从而把模型从条件信息引导到子任务轨迹的一致映射。
② 统一坐标系:两次对齐
针对“同一动作方向各异”的顽疾,团队对占总量 80%以上的第一人称双臂数据做了双重对齐,这是VPP2最具实操价值的部分:
![]()
图注:(a)工作空间对齐:边界框(图a)展示不同数据集对齐后的工作空间,通过施加世界坐标系变换,让不同机器人的工作空间可比较;(b)末端执行器对齐(图b):通过局部变换统一夹爪的原点与坐标轴方向。两次对齐之后,"向左/向右"等动作语义才在所有数据集之间保持一致。
![]()
对于多机位数据,团队将其编排成“T形合成图”:主视角位于左侧,两个辅助视角在右侧纵向堆叠;当辅助视角不足两个时,用黑色占位图像填充空缺。这样既保留了多视角信息,又形成了统一的输入规格。
4.VPP2能泛化的【关键点-2】:合理的训练流程
数据就位后,VPP2构建于预训练的Wan2.1-12V-14B视频模型之上,通过三个目标分明的阶段,依次完成“练眼—提速—练手”。
![]()
图注:阶段(1)继续预训练:在覆盖完整轨迹的事件级数据上做“视频事件预测”,输入/输出整段视频;阶段(2)后训练与蒸馏:在定长视频块上做“长视频块预测”,并通过蒸馏把多步生成压成单步;阶段(3)动作 DiT 预训练:视频块与动作块配对,由 Video DiT 与 Action DiT 共同完成“短动作块生成”。最右侧的注意力掩码规定了观测 token(o)与动作 token(a)之间可见与不可见的关系。
① 阶段 1:事件级视频模型继续预训练
给定一条演示视频,在整个事件范围内均匀采样N个未来帧,让模型学会从初始条件预测一个完整子任务的演变。这一阶段使用大规模事件级视频片段,目标是得到一个可泛化的视频预测模型,而不是急于输出动作。
② 阶段 2:块级后训练+一致性蒸馏
事件级视频片段时长不一,难以与动作的时间间隔严格对齐。VPP2改为在固定时域的视频块上后训练;更关键的是引入一致性蒸馏(Consistency Distillation):原本需要多步迭代去噪的生成过程,被蒸馏成只需单次前向即可出结果,为实时闭环扫清速度障碍。为强调单步生成,训练时以0.5的概率直接采样到终点时刻。
③阶段 3:跨数据集动作DiT预训练
最后才引入动作模块:一个仅0.9B参数的动作专家,采用混合Transformer(Mixture-of-Transformers, MoT)架构,在跨机器人统一后的动作空间上,学习隐式逆动力学模型——即根据视频预测结果反推应执行的动作。动作模块以全新初始化的方式接入,且全程保留预训练视频表示,从而在注入动作能力时不破坏泛化性。
![]()
④VLM双重角色:用“详细描述”破除虚假相关,用“详细分层规划”打通长任务
除了底层的视频—动作回路,VPP2还用一个VLM承担分层高层规划:面对“收拾餐桌”这类模糊长任务,VLM把它拆解为一串详细子任务描述,再依次交给动作专家。VPP2采用分层架构,由VLM负责高层推理、语义理解与记忆,动作专家负责底层执行。
6张“成绩单”看VPP2 到底强在哪?
VPP2在视频预测、指令遵循、真实机器人、LIBERO泛化、RoboDojo仿真、高层规划六条战线上系统验证了方法。
1.视频预测:超越英伟达Cosmos3-Super-64B
图中展示了预训练VPP2对人手和机器人操作的视频预测(30步)。在大规模、多样化操作数据上训练后,模型可泛化到人手与多种机器人载体,并将1–3个摄像机视角编排为T形合成图。
![]()
图注:每一行给出一个任务的多帧预测序列,涵盖“抓取黑色气嘴”“把勺子放在 iPad上”“打开烤箱”“掀开白色瓶盖”“合上笔记本”“用纸巾擦屏幕”“转移拖鞋”“用剪刀剪纸”“擦白板”“装箱”“盖瓶盖”“把绿块放到控制器上”“翻转包装袋”“把方块扫入簸箕”等20组任务。预测序列在物体运动、夹爪轨迹上保持连贯。
为量化预测质量,团队让预训练VPP2与四个视频基础模型在“图像—指令对”上两两对战,由模型和人工分别评估谁的预测更符合指令。
![]()
图注:横向堆叠条为“基线获胜 / 平局 / VPP2获胜”的比例,左为人手、右为机器人。对机器人操作,VPP2对Wan-14B 胜率高达96%,对Cosmos3-64B也取得68%胜率;即使在人手数据上,对四个基线也全面占优。
2.指令遵循:复杂空间任务上更可靠
图中用红/绿圈标出目标物体,直观对比VPP2、Wan-14B、Cosmos3-64B的指令遵循能力。可以看到,在需要空间理解的复杂任务上,VPP2更准确地把动作落到指定物体上。
![]()
图注:任务(a)“抓取最左侧瓶子、放到矮杯前方”、任务(b)“把红色纸杯叠到最左侧黑色纸杯上”。Cosmos3-64B的预测在红圈处偏离了目标,而 VPP2(绿圈)稳定命中。VPP2在人类与机器人两类指令遵循上均为最优;摘要所述“视频预测指令遵循成功率比Cosmos3-64B高11.0/14个百分点”与此一致。
3.真实世界ALOHA:零样本9/10类任务夺冠
在真实ALOHA平台随机选取的10个任务类别上做零样本成功率测试;为公平比较,π0.5与FastWAM也在VPP2训练数据所包含的全部ALOHA数据上微调。
![]()
图注:堆叠/抓取/放置/折叠/倾倒/拉取/插入/打开/闭合/擦拭 10 类任务上,VPP2(绿)在 9 类上高于 π0.5(紫)与 FastWAM-14B(灰)。平均成功率 58.5%,对比 π0.5 的 40.0%、FastWAM的20.5%;单任务增益最大达47.8%对6.8%。
4.LIBERO-Pro:分布内高分真正转化为泛化
VPP2在LIBERO-Pro上总体成功率达45.0%(VLA基线最高仅11.0%),在 LIBERO-OOD上达63.9%,同时超过专门为弥补该泛化差距设计的Temporal Ratio。
5.RoboDojo:仿真基准双指标第一
RoboDojo是一个统一的双臂仿真基准,含42个双臂任务、覆盖五个能力维度。VPP2取得39.26 的平均得分与32.26%的成功率,超过包括GPT-6-Astra在内的全部对比方法。
6.高层规划增益:与大模型完美配合
团队在五个选定任务组上对比“是否采用基于VLM的子任务规划”(每任务50次试验)。接入规划后平均成功率从27.6%跃升至57.6%。
![]()
图注:五个任务组中,"VPP2+子任务规划"(深蓝)全面高于纯 VPP2(灰)。增益最大的是语言条件方块堆叠(10% → 52%)与井字棋(0% → 38%),平均 27.6% → 57.6%。这证明VLM规划对长程、多步任务尤为关键。
Agentic system 2+WAM system 1 极致推理和快速响应的配合
VPP2的价值不止于刷新WAM的SOTA,更在于提供了一套忠实跟随语言快速响应的快系统,将语言指令忠实地映射到物理世界中。
GPT代表“认知智能”,擅长语言理解、推理与规划,回答“做什么、为什么做”;但它没有物理世界的“身体”,不理解重力、碰撞、摩擦,也无法实时感知与闭环——会想,却不一定会做。VPP2补上的正是物理智能这一环:通过视频预测理解物理动力学,把高层指令转化为时序连贯、物理可行的动作轨迹,回答“怎么做、做得到”。
GPT管“想”、VPP2管“做”:物理AI=通用认知×通用物理执行。未来,二者结合可形成“认知—规划—预测—执行—反馈”的完整闭环:GPT当作system2,把模糊目标拆解为子任务;VPP2当作system1,产生条件反射一般的快速响应,把子任务稳稳落地,真实数据再回流反哺两端。相关数据直接验证了这一点:接入VLM分层规划器后,某些任务平均成功率从27.6%跃升至57.6%。未来物理AI的完整能力范式=通用认知×通用物理执行,缺一不可。
至此,星动纪元具身模型一年内连夺全球四榜冠军:
· 2月,击败谷歌、英伟达!清华陈建宇×斯坦福Chelsea团队世界模型Ctrl-World具身能力登顶全球
· 4月,击败PI!星动纪元斩获「具身灵巧操作奥林匹克」三项全球第一!
· 5月,星动纪元登顶RoboChallenge榜首!17项家务活斩获NO.1
· 10月,在RoboDojo突围GPT-6,未用额外数据、无RSI,无外挂登顶榜首。
![]()
技术的价值,最终要在真实场景兑现生产力。星动纪元是最早进入物流行业的具身机器人企业,已率先完成行业首个PMF验证:与中国邮政、顺丰合作,在全国 5 个省市、10 余个物流中心常态化运营,成果获外交部发言人、央视公开点赞——把WAM的技术优势变成了看得见、用得上的新质生产力。
从斩获全球权威四榜冠军,到物流产线规模化上岗,星动纪元正沿着“预测得更好、行动得更好”的方向,向着“打造物理世界通用智能体,让机器人成为人类可靠伙伴”的愿景迈进。
来源:星动纪元
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.