网易首页 > 网易号 > 正文 申请入驻

给机器人一个会预测未来的Critic,VLA强化学习直接起飞

0
分享至

来源:市场资讯

(来源:机器之心)

一台机械臂正伸向转盘上的寿司。此刻,它是在稳定接近目标,还是已经错过最佳抓取时机?夹爪与物体接触得恰到好处,还是下一秒就会把寿司撞飞?只看一张静态图片,这些状态几乎一模一样。

但在不少视觉-语言-动作模型强化学习(VLA-RL)方法中,负责评价当前状态好坏的批评家模型(Critic Model),恰恰主要依赖单帧观测或单帧 VLM 特征来打分。这就像让一名只看比赛截图、没有回放的裁判,判断运动员究竟是在完成关键动作,还是已经失去平衡。

近期,OpenMOSS 团队开源了 World Critic Model(WCM)。它提出了一个直接却常被忽略的问题:机器人控制天然是一个部分可观测问题。既然一帧画面看不清动态,为什么 Critic 还要“凭一帧图打分”?


图 1|WCM 从单帧 Critic 的局限出发,将世界预测与价值学习统一起来。

WCM 的答案不是简单堆叠更多图像,而是让 Critic 在估计价值的同时,学习预测执行动作后的下一时刻潜在状态。换句话说,它不仅要回答“现在有多好”,还要回答: “照这样做下去,接下来会发生什么?”

WCM 的代码、数据、权重全开源,仅 15 分钟训练即可得到真机价值曲线!


  • 论文标题:WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

  • 论文:https://arxiv.org/pdf/2607.29613

  • 代码:https://github.com/sylvestf/WCM

  • 数据:https://huggingface.co/collections/Sylvest/wcm

WCM 在 4 个仿真基准、149 项任务,以及 7 项真实机器人任务上进行了系统验证,覆盖抓取、柔性物体、长程和动态目标操作任务。同时,WCM 可搭配三种主流 VLA 模型:π₀、π₀.₅、OpenVLA-OFT。

其中最醒目的结果之一来自 ManiSkill:一个此前没有接触过 ManiSkill 数据、初始成功率仅 0.78% 的 VLA 模型,在 WCM 引导的强化学习后达到 98.7%,提升了 97.9 个百分点。更重要的是,提升并没有只发生在训练分布内,在 OOD 平均成功率上也取得了 72.7% 的提升。

这组结果指向了 WCM 最核心的价值:它不只是把训练任务做得更熟,还让 Critic 在环境变化后更不容易看走眼。

01|VLA-RL 的 Critic

可能一直少看了最关键的信息

在 Actor-Critic 类强化学习中,策略(Policy)决定做什么,Critic 则负责判断这个状态有多好,并据此计算优势、指导 Policy 更新。因此,Critic 并不是一个可有可无的配角。Critic 的判断一旦失真,Policy 就可能被非常自信地带向错误方向。


图 2|Critic 负责判断当前状态有多好。图为 WCM 的价值估计曲线,当发生碰撞导致物体掉落时曲线开始下降。

问题在于,机器人操作通常可以建模为部分可观测马尔可夫决策过程(POMDP)。单帧画面可以告诉模型物体在哪里、机械臂大致处于什么姿态、当前场景包含哪些视觉元素。但它往往无法可靠告诉模型:机械臂正在靠近还是远离目标;夹爪是否刚刚发生滑移;当前接触是稳定支撑还是即将碰撞;目标物体是否仍在运动;动作序列是在向成功推进,还是已经进入不可恢复的失败……


图 3|机器人操作任务具有部分可观测性质,智能体只能通过观测重建系统状态。

以擦拭灶台为例,同样是末端执行器接近桌面,可能代表“正在施力清洁”,也可能代表“机械臂被桌面卡住”。像素很像,价值却完全不同。这也是为什么在真实机器人实验中,单帧 Critic 容易学到一些危险的伪相关:例如把“末端靠近桌面”一概视为高价值,最终导致机械臂反复顶住台面。

02|反直觉的是

给 Critic 多看几帧,也未必有用

既然单帧不够,最自然的方案似乎是把多帧图像直接堆起来,或者加一个时序 Transformer。但论文发现,事情并没有这么简单。

真正缺少的不是“历史输入”本身,而是迫使模型理解历史变化的监督信号。

传统 Critic 的核心目标通常只是回归一个标量回报。面对高维图像序列,这个监督过于稀疏。即使输入中包含过去几帧,模型也可能把它们当成一块更大的静态特征,而不是去学习物体如何运动、接触如何变化、动作将把环境带向哪里。

实验中出现了三个值得注意的现象:(1)直接给原始 Critic 增加历史观测,性能可能反而下降;(2)换成具备时序建模能力的 Transformer,但不加入世界预测目标,仍然难以利用历史;(3)只有在加入未来状态预测后,多帧历史才稳定转化为更好的价值估计。


图 4|MLP、仅时序 ViT 与完整 WCM 的对比。完整 WCM 在不同骨干和任务上取得最高整体表现。

这个结论也解释了一个常见误区: “有记忆”不等于“理解动态”;只有可预测的历史表征,才更接近机器人真正需要的状态。

03|WCM 怎么做

让 Critic 一边打分,一边做未来推演

WCM 基于轻量级 LeJEPA 风格架构,由四个关键部分组成:观测编码器、世界预测器、价值头、动态预测头。整个过程可以拆成四步:


图 5|WCM 核心架构:共享的历史表征同时服务于价值估计与下一潜在状态预测。

第一步:编码连续历史。WCM 接收最近 K 帧观测。每一帧先被独立编码为潜在表示。在不同实现中,编码器既可以是 ViT,也可以直接复用 VLA 的 VLM Backbone。

第二步:加入语言条件。机器人执行的不是无条件动作。“把胡萝卜放到盘子里”和“折叠毛巾”,即使视觉画面相似,对状态价值的定义也完全不同。因此,WCM 通过语言编码与适配模块,把任务指令注入历史表征。

第三步:用因果时序模型聚合历史。经过语言条件化的多帧特征,被送入因果 Transformer World Predictor,形成当前的历史状态表示。这个表示不是简单的多帧拼接,而是要同时支持两件事:判断当前状态的预期回报;结合当前动作,预测下一时刻的潜在状态。

第四步:双头联合学习。WCM 设置两个轻量预测头:Value Head 输出当前状态价值;World Head 接收动作条件,预测下一潜在状态。

其总体目标可以概括为:总损失 = 价值回归损失 + 世界预测损失 + 特征空间正则损失。其中,特征空间使用 SIGReg 抑制潜在表示发生维度坍缩。这里有一个设计细节非常关键:价值估计保持 action-free,而状态转移预测是 action-conditioned。也就是说,WCM 不会把状态有多好和执行某个动作后会怎样混为一谈,却又允许两类目标共同改善共享表征。

WCM 也不是一个额外生成像素、规模庞大的视频世界模型。它预测的是任务相关的下一潜在状态,目标非常明确:让 Critic 学会捕捉对价值判断真正有用的动态。

04|它不绑定某一种 RL

On-policy 与 Off-policy 都能接

WCM 的另一个特点,是没有重新发明一整套强化学习算法,而是作为 Critic 接入现有训练流程。在同策略(On-policy)学习场景中:自回归 VLA 可接入 PPO,Flow Matching VLA 可接入 Flow-SDE,WCM 提供价值估计,用于计算 Return 与 GAE Advantage;在异策略(Off-policy)学习场景中:OpenVLA-OFT 可结合 AWR,π₀.₅ 可结合 RECAP,SFT 数据、成功 Rollout 和失败 Rollout 被放入统一数据缓冲区,用于持续更新 Critic 与 Policy。


图 6|WCM 可直接嵌入 On-policy 与 Off-policy 两类 VLA-RL 管线。

这种模块化设计意味着,WCM 更像一次对 Critic 表征学习方式的升级,而不是只能在特定 Policy 或特定算法上生效的技巧。

05|实验结果:IND 和 OOD 的双重 SOTA

在 RL4VLA 设置的 Maniskill 任务上,加了 WCM 的强化学习取得了分布内(IND)和分布外(OOD)的双重 SOTA 性能。更令人瞩目的是,在零样本(Zero-Shot)设定下,WCM 直接将近乎无效的 0.8 分拉升至 98.7 分,提升高达 97.9 分,充分验证了其卓越的泛化能力与强化学习适配效果。


表 1|WCM 在 Maniskill 分布内和分布外测试集上取得 SOTA 结果。

团队在 LIBERO-Plus 基准上设计了一组极具说服力的对比实验。其中,One-SFT 表示每项任务仅提供 1 条示范数据,而 Full-SFT 则提供多达 50 条。实验结果显示,基于 One-SFT 的 WCM 方法,仅需约 250 步的强化学习微调,便能从极简的初始策略出发,在总体性能上成功反超依赖大量示范的 Full-SFT 基线。


表 2|WCM 在 LIBERO-Plus 泛化测试基准上通过 250 步 RL 训练即可超越 Full-SFT。

这并不意味着示范数据不重要,而是说明:当 Critic 能更准确地理解动态与结果,环境交互产生的失败数据也可以变成非常有价值的学习信号。

在 MetaWorld 与 CALVIN 上,WCM 同样使得持续接触和长程操作的表现稳定提升。


图 7|WCM 在 MetaWorld 成功率与 CALVIN 平均任务完成均取得亮眼表现。

真机方面,团队在 WidowX-250S 上测试了 7 个任务:胡萝卜、香蕉、甜椒抓取放置;叠衣服、叠毛巾;灶台整理;转盘寿司动态抓取。每项任务首先采集 100 条遥操作轨迹,随后进行 8 轮 RL 更新;每轮、每项任务收集 50 条 Rollout。相较于使用 VLM Critic Model 进行 RL 训练,使用 WCM 的方法可以取得更好的性能。


表 3|使用 WCM 进行真机强化学习,可以获得比 VLM Critic 更好的效果。

真实机器人设置中的 WCM 约有 107.2M 可训练参数。数百到数千条轨迹的数据规模下,WCM 可在不到半小时内完成快速迭代。而且,这种提升不只体现在最后有没有成功,WCM 训练出的 Policy 动作更连贯,停顿和无效小动作更少,因此单位时间内的吞吐量也更多。


图 8|在叠毛巾、灶台整理和抓取旋转寿司任务上,RECAP + WCM 的吞吐量均高于 Gemma Critic。

06|价值曲线可视化

WCM 仓库提供了价值曲线视频生成工具。把模型预测的价值叠加到真实轨迹后,可以直观看到它如何评价动作进展。


图 9|对于成功轨迹:价值随任务推进整体上升。


图 10|对于失败轨迹:从开始失败的时刻起,价值快速下降。


图 11|对于无效轨迹:随机运动没有形成稳定的成功趋势。

可视化说明 WCM 学到的并非简单的终点分类器,而是一个能够反映过程变化的连续评价信号。在真实数据中,暂停、滑移、碰撞、抓姿不佳或折叠不整齐,都会让价值曲线停滞或下降。

07|结语

如果你正在研究 VLA、机器人强化学习、Critic Model 或真机后训练,WCM 提供了代码、数据处理脚本、训练配置、模型权重以及价值曲线可视化工具,适合作为一个新的可复现基线。

当机器人不再只看“这一帧”,它才更有可能理解自己正在走向哪里。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
5岁女童被踢掉4颗牙,运营方回应:是宇树机器人

5岁女童被踢掉4颗牙,运营方回应:是宇树机器人

中国新闻周刊
2026-08-26 14:09:02
最新 | 张嘉益工作室发布声明

最新 | 张嘉益工作室发布声明

天津广播
2026-08-25 09:49:14
她是北京独生女,部队大院长大,父母军艺毕业,出道12年终于火了

她是北京独生女,部队大院长大,父母军艺毕业,出道12年终于火了

寒士之言本尊
2026-08-25 16:24:50
大半个车圈涉及400万辆车召回,比亚迪、华为系为何缺席?

大半个车圈涉及400万辆车召回,比亚迪、华为系为何缺席?

言车有徐
2026-08-25 14:53:23
《道德经》:你要平静到可以失去任何人,任何关系,任何人靠近你,都只是为了帮你完成人生的课题,对聚散不要有执念,万物不必强留

《道德经》:你要平静到可以失去任何人,任何关系,任何人靠近你,都只是为了帮你完成人生的课题,对聚散不要有执念,万物不必强留

心理观察局
2026-08-01 07:00:05
没想到,安以轩被判14年的富豪丈夫,竟给她留下了两张好牌

没想到,安以轩被判14年的富豪丈夫,竟给她留下了两张好牌

随意吃瓜
2026-08-25 17:41:32
台风“沙德尔”路径有变!对上海的风雨影响→

台风“沙德尔”路径有变!对上海的风雨影响→

上海宝山
2026-08-26 15:37:10
41.28度电!奇瑞新车公布:5.98万元起!

41.28度电!奇瑞新车公布:5.98万元起!

电动内参
2026-08-24 11:31:50
晚年李讷透露:曾问父亲与谁关系最好?毛主席说出3个人的名字

晚年李讷透露:曾问父亲与谁关系最好?毛主席说出3个人的名字

凡人侃史
2026-08-15 13:51:58
第二个许家印!又一首富栽了!世界500强竟是假的,千亿帝国清零

第二个许家印!又一首富栽了!世界500强竟是假的,千亿帝国清零

蜉蝣说
2026-07-17 09:47:08
儿子高考712分,父亲带出国旅游在海关被拦,父亲:我没这个儿子

儿子高考712分,父亲带出国旅游在海关被拦,父亲:我没这个儿子

萧竹轻语
2025-07-11 21:59:37
猫学长上课睡觉还打呼,被老师丢粉笔头…网友:猫头这点面积也能砸到吗

猫学长上课睡觉还打呼,被老师丢粉笔头…网友:猫头这点面积也能砸到吗

拜见喵主子
2026-08-25 21:17:00
私生子传闻时隔 13 个月,何猷君奚梦瑶近况曝光,婚变传闻尘埃落定

私生子传闻时隔 13 个月,何猷君奚梦瑶近况曝光,婚变传闻尘埃落定

搞笑娱乐笑话
2026-08-25 11:56:42
马克龙即将下台,接班人基本锁定,中国将面对一个完全不同的法国

马克龙即将下台,接班人基本锁定,中国将面对一个完全不同的法国

叹为观止易
2026-08-26 11:22:07
宇树科技6连杀!股价“腰斩”市值蒸发2000亿,仍较1年前百亿估值暴涨20多倍,腾讯、阿里、吉利等赚得盆满钵满

宇树科技6连杀!股价“腰斩”市值蒸发2000亿,仍较1年前百亿估值暴涨20多倍,腾讯、阿里、吉利等赚得盆满钵满

金融界
2026-08-26 17:28:54
狱友问我怎么进来的,我:贪10个亿。狱警上来就是一脚:装什么

狱友问我怎么进来的,我:贪10个亿。狱警上来就是一脚:装什么

悬案解密档案
2026-02-26 15:34:48
这就是赤裸裸的现实!工商银行已经到了最危险的时候?

这就是赤裸裸的现实!工商银行已经到了最危险的时候?

财经保探长
2026-08-23 21:43:55
两性心理学:不管你有多爱一个女人,只要她敢在床上有这表现,你必须放手

两性心理学:不管你有多爱一个女人,只要她敢在床上有这表现,你必须放手

心理观察局
2026-08-26 06:41:46
你是我的心上人:那不是称呼,是我在心跳间隙为你预留的固定落点

你是我的心上人:那不是称呼,是我在心跳间隙为你预留的固定落点

疾跑的小蜗牛
2026-08-26 19:12:12
离婚后,陈妍希一人独居北京卧室朴素,首谈失败婚姻称陈晓靠不住

离婚后,陈妍希一人独居北京卧室朴素,首谈失败婚姻称陈晓靠不住

椰黄娱乐
2026-08-24 11:37:51
2026-08-26 22:36:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4557895文章数 9359关注度
往期回顾 全部

科技要闻

DeepSeek被曝前七个月收入4.75亿元

头条要闻

男子未领证办婚礼后离世留400万财产 女方要求分200万

头条要闻

男子未领证办婚礼后离世留400万财产 女方要求分200万

体育要闻

兑现五年之约,含梗量最高的世界冠军诞生

娱乐要闻

包文婧当初担心包贝尔出轨,预言成真

财经要闻

洪灏:人民币是全球最被低估的货币

汽车要闻

硬派增程SUV新选手 北汽泰钽700上市焕新价24.98万起

态度原创

家居
艺术
数码
房产
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

吴冠中画了幅双面画,值690万!

数码要闻

佳明Fenix 9 Pro智能手表预售:全钛金属表身,8680元起

房产要闻

煤老板出手,海口又要杀出一个超级大盘!

军事要闻

特朗普赞赏后 三个美国盟友邀请伊朗加入"中东版北约"

无障碍浏览 进入关怀版