网易首页 > 网易号 > 正文 申请入驻

给机器人一个会预测未来的Critic,VLA强化学习直接起飞

0
分享至



一台机械臂正伸向转盘上的寿司。此刻,它是在稳定接近目标,还是已经错过最佳抓取时机?夹爪与物体接触得恰到好处,还是下一秒就会把寿司撞飞?只看一张静态图片,这些状态几乎一模一样。

但在不少视觉-语言-动作模型强化学习(VLA-RL)方法中,负责评价当前状态好坏的批评家模型(Critic Model),恰恰主要依赖单帧观测或单帧 VLM 特征来打分。这就像让一名只看比赛截图、没有回放的裁判,判断运动员究竟是在完成关键动作,还是已经失去平衡。

近期,OpenMOSS 团队开源了World Critic Model(WCM)。它提出了一个直接却常被忽略的问题:机器人控制天然是一个部分可观测问题。既然一帧画面看不清动态,为什么 Critic 还要“凭一帧图打分”?



图 1|WCM 从单帧 Critic 的局限出发,将世界预测与价值学习统一起来。

WCM 的答案不是简单堆叠更多图像,而是让 Critic 在估计价值的同时,学习预测执行动作后的下一时刻潜在状态。换句话说,它不仅要回答“现在有多好”,还要回答:“照这样做下去,接下来会发生什么?”

WCM 的代码、数据、权重全开源,仅 15 分钟训练即可得到真机价值曲线!



  • 论文标题:WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
  • 论文:https://arxiv.org/pdf/2607.29613
  • 代码:https://github.com/sylvestf/WCM
  • 数据:https://huggingface.co/collections/Sylvest/wcm

WCM 在 4 个仿真基准、149 项任务,以及 7 项真实机器人任务上进行了系统验证,覆盖抓取、柔性物体、长程和动态目标操作任务。同时,WCM 可搭配三种主流 VLA 模型:π₀、π₀.₅、OpenVLA-OFT。

其中最醒目的结果之一来自 ManiSkill:一个此前没有接触过 ManiSkill 数据、初始成功率仅 0.78% 的 VLA 模型,在 WCM 引导的强化学习后达到 98.7%,提升了 97.9 个百分点。更重要的是,提升并没有只发生在训练分布内,在 OOD 平均成功率上也取得了 72.7% 的提升。

这组结果指向了 WCM 最核心的价值:它不只是把训练任务做得更熟,还让 Critic 在环境变化后更不容易看走眼。

01|VLA-RL 的 Critic

可能一直少看了最关键的信息

在 Actor-Critic 类强化学习中,策略(Policy)决定做什么,Critic 则负责判断这个状态有多好,并据此计算优势、指导 Policy 更新。因此,Critic 并不是一个可有可无的配角。Critic 的判断一旦失真,Policy 就可能被非常自信地带向错误方向。



图 2|Critic 负责判断当前状态有多好。图为 WCM 的价值估计曲线,当发生碰撞导致物体掉落时曲线开始下降。

问题在于,机器人操作通常可以建模为部分可观测马尔可夫决策过程(POMDP)。单帧画面可以告诉模型物体在哪里、机械臂大致处于什么姿态、当前场景包含哪些视觉元素。但它往往无法可靠告诉模型:机械臂正在靠近还是远离目标;夹爪是否刚刚发生滑移;当前接触是稳定支撑还是即将碰撞;目标物体是否仍在运动;动作序列是在向成功推进,还是已经进入不可恢复的失败……



图 3|机器人操作任务具有部分可观测性质,智能体只能通过观测重建系统状态。

以擦拭灶台为例,同样是末端执行器接近桌面,可能代表“正在施力清洁”,也可能代表“机械臂被桌面卡住”。像素很像,价值却完全不同。这也是为什么在真实机器人实验中,单帧 Critic 容易学到一些危险的伪相关:例如把“末端靠近桌面”一概视为高价值,最终导致机械臂反复顶住台面。

02|反直觉的是

给 Critic 多看几帧,也未必有用

既然单帧不够,最自然的方案似乎是把多帧图像直接堆起来,或者加一个时序 Transformer。但论文发现,事情并没有这么简单。

真正缺少的不是“历史输入”本身,而是迫使模型理解历史变化的监督信号。

传统 Critic 的核心目标通常只是回归一个标量回报。面对高维图像序列,这个监督过于稀疏。即使输入中包含过去几帧,模型也可能把它们当成一块更大的静态特征,而不是去学习物体如何运动、接触如何变化、动作将把环境带向哪里。

实验中出现了三个值得注意的现象:(1)直接给原始 Critic 增加历史观测,性能可能反而下降;(2)换成具备时序建模能力的 Transformer,但不加入世界预测目标,仍然难以利用历史;(3)只有在加入未来状态预测后,多帧历史才稳定转化为更好的价值估计。



图 4|MLP、仅时序 ViT 与完整 WCM 的对比。完整 WCM 在不同骨干和任务上取得最高整体表现。

这个结论也解释了一个常见误区:“有记忆”不等于“理解动态”;只有可预测的历史表征,才更接近机器人真正需要的状态。

03|WCM 怎么做

让 Critic 一边打分,一边做未来推演

WCM 基于轻量级 LeJEPA 风格架构,由四个关键部分组成:观测编码器、世界预测器、价值头、动态预测头。整个过程可以拆成四步:



图 5|WCM 核心架构:共享的历史表征同时服务于价值估计与下一潜在状态预测。

第一步:编码连续历史。WCM 接收最近 K 帧观测。每一帧先被独立编码为潜在表示。在不同实现中,编码器既可以是 ViT,也可以直接复用 VLA 的 VLM Backbone。

第二步:加入语言条件。机器人执行的不是无条件动作。“把胡萝卜放到盘子里”和“折叠毛巾”,即使视觉画面相似,对状态价值的定义也完全不同。因此,WCM 通过语言编码与适配模块,把任务指令注入历史表征。

第三步:用因果时序模型聚合历史。经过语言条件化的多帧特征,被送入因果 Transformer World Predictor,形成当前的历史状态表示。这个表示不是简单的多帧拼接,而是要同时支持两件事:判断当前状态的预期回报;结合当前动作,预测下一时刻的潜在状态。

第四步:双头联合学习。WCM 设置两个轻量预测头:Value Head 输出当前状态价值;World Head 接收动作条件,预测下一潜在状态。

其总体目标可以概括为:总损失 = 价值回归损失 + 世界预测损失 + 特征空间正则损失。其中,特征空间使用 SIGReg 抑制潜在表示发生维度坍缩。这里有一个设计细节非常关键:价值估计保持 action-free,而状态转移预测是 action-conditioned。也就是说,WCM 不会把状态有多好和执行某个动作后会怎样混为一谈,却又允许两类目标共同改善共享表征。

WCM 也不是一个额外生成像素、规模庞大的视频世界模型。它预测的是任务相关的下一潜在状态,目标非常明确:让 Critic 学会捕捉对价值判断真正有用的动态。

04|它不绑定某一种 RL

On-policy 与 Off-policy 都能接

WCM 的另一个特点,是没有重新发明一整套强化学习算法,而是作为 Critic 接入现有训练流程。在同策略(On-policy)学习场景中:自回归 VLA 可接入 PPO,Flow Matching VLA 可接入 Flow-SDE,WCM 提供价值估计,用于计算 Return 与 GAE Advantage;在异策略(Off-policy)学习场景中:OpenVLA-OFT 可结合 AWR,π₀.₅ 可结合 RECAP,SFT 数据、成功 Rollout 和失败 Rollout 被放入统一数据缓冲区,用于持续更新 Critic 与 Policy。



图 6|WCM 可直接嵌入 On-policy 与 Off-policy 两类 VLA-RL 管线。

这种模块化设计意味着,WCM 更像一次对Critic 表征学习方式的升级,而不是只能在特定 Policy 或特定算法上生效的技巧。

05|实验结果:IND 和 OOD 的双重 SOTA

在 RL4VLA 设置的 Maniskill 任务上,加了 WCM 的强化学习取得了分布内(IND)和分布外(OOD)的双重 SOTA 性能。更令人瞩目的是,在零样本(Zero-Shot)设定下,WCM 直接将近乎无效的 0.8 分拉升至 98.7 分,提升高达 97.9 分,充分验证了其卓越的泛化能力与强化学习适配效果。



表 1|WCM 在 Maniskill 分布内和分布外测试集上取得 SOTA 结果。

团队在 LIBERO-Plus 基准上设计了一组极具说服力的对比实验。其中,One-SFT 表示每项任务仅提供 1 条示范数据,而 Full-SFT 则提供多达 50 条。实验结果显示,基于 One-SFT 的 WCM 方法,仅需约 250 步的强化学习微调,便能从极简的初始策略出发,在总体性能上成功反超依赖大量示范的 Full-SFT 基线。



表 2|WCM 在 LIBERO-Plus 泛化测试基准上通过 250 步 RL 训练即可超越 Full-SFT。

这并不意味着示范数据不重要,而是说明:当 Critic 能更准确地理解动态与结果,环境交互产生的失败数据也可以变成非常有价值的学习信号。

在 MetaWorld 与 CALVIN 上,WCM 同样使得持续接触和长程操作的表现稳定提升。



图 7|WCM 在 MetaWorld 成功率与 CALVIN 平均任务完成均取得亮眼表现。

真机方面,团队在 WidowX-250S 上测试了 7 个任务:胡萝卜、香蕉、甜椒抓取放置;叠衣服、叠毛巾;灶台整理;转盘寿司动态抓取。每项任务首先采集 100 条遥操作轨迹,随后进行 8 轮 RL 更新;每轮、每项任务收集 50 条 Rollout。相较于使用 VLM Critic Model 进行 RL 训练,使用 WCM 的方法可以取得更好的性能。



表 3|使用 WCM 进行真机强化学习,可以获得比 VLM Critic 更好的效果。

真实机器人设置中的 WCM 约有 107.2M 可训练参数。数百到数千条轨迹的数据规模下,WCM 可在不到半小时内完成快速迭代。而且,这种提升不只体现在最后有没有成功,WCM 训练出的 Policy 动作更连贯,停顿和无效小动作更少,因此单位时间内的吞吐量也更多。



图 8|在叠毛巾、灶台整理和抓取旋转寿司任务上,RECAP + WCM 的吞吐量均高于 Gemma Critic。

06|价值曲线可视化

WCM 仓库提供了价值曲线视频生成工具。把模型预测的价值叠加到真实轨迹后,可以直观看到它如何评价动作进展。



图 9|对于成功轨迹:价值随任务推进整体上升。



图 10|对于失败轨迹:从开始失败的时刻起,价值快速下降。



图 11|对于无效轨迹:随机运动没有形成稳定的成功趋势。

可视化说明 WCM 学到的并非简单的终点分类器,而是一个能够反映过程变化的连续评价信号。在真实数据中,暂停、滑移、碰撞、抓姿不佳或折叠不整齐,都会让价值曲线停滞或下降。

07|结语

如果你正在研究 VLA、机器人强化学习、Critic Model 或真机后训练,WCM 提供了代码、数据处理脚本、训练配置、模型权重以及价值曲线可视化工具,适合作为一个新的可复现基线。

当机器人不再只看“这一帧”,它才更有可能理解自己正在走向哪里。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
动手了,美军突然开了火!

动手了,美军突然开了火!

故事终将光明磊落
2026-08-12 09:53:10
交易球员算什么?湖人被125亿美元兜售,前老板接手一年赚20多亿

交易球员算什么?湖人被125亿美元兜售,前老板接手一年赚20多亿

兵鉴史
2026-08-13 17:41:25
穆里尼奥慧眼识珠!皇马挖出绝世瑰宝!18 岁天才横空出世

穆里尼奥慧眼识珠!皇马挖出绝世瑰宝!18 岁天才横空出世

澜归序
2026-08-13 06:45:19
寄四把折叠椅,预估运费252元实收779元,嫌贵不寄了咋还得掏运费钱?多方回应

寄四把折叠椅,预估运费252元实收779元,嫌贵不寄了咋还得掏运费钱?多方回应

极目新闻
2026-08-12 15:06:22
北京知青与青海姑娘被迫分开,20年后当了大官,才得知儿孙满堂

北京知青与青海姑娘被迫分开,20年后当了大官,才得知儿孙满堂

兰姐说故事
2025-03-16 20:00:09
这就是赤裸裸的现实!工商银行已经到了最危险的时候?

这就是赤裸裸的现实!工商银行已经到了最危险的时候?

小陆搞笑日常
2026-08-13 00:00:12
王水牛事件涉事女生拼命清理账号,作为受害者也跟着一起遭殃

王水牛事件涉事女生拼命清理账号,作为受害者也跟着一起遭殃

映射生活的身影
2026-08-12 17:18:36
穆里尼奥:今天没能尽早杀死悬念;这种强度的练兵很有好处

穆里尼奥:今天没能尽早杀死悬念;这种强度的练兵很有好处

懂球帝
2026-08-13 06:18:09
郭德纲篡改红歌被立案调查,澳洲坐拥巨额资产,铺好后路进退皆无忧

郭德纲篡改红歌被立案调查,澳洲坐拥巨额资产,铺好后路进退皆无忧

娱乐E君
2026-08-13 10:48:17
浙江一家公司,收到美国政府2.62亿元关税退税

浙江一家公司,收到美国政府2.62亿元关税退税

每日经济新闻
2026-08-12 16:54:11
普京首次登上俄日争议岛屿

普京首次登上俄日争议岛屿

界面新闻
2026-08-13 11:46:27
立秋后,这3种鱼再贵也要买,隔天吃一次,健脾养胃增免疫

立秋后,这3种鱼再贵也要买,隔天吃一次,健脾养胃增免疫

阿龙美食记
2026-08-10 15:21:07
成都一家面馆火了,却要歇业两天!老板:流量太大避避风头

成都一家面馆火了,却要歇业两天!老板:流量太大避避风头

红星新闻
2026-08-12 19:11:30
哈佛发现:10种食物最能长肌肉,第一名多数人家里没有

哈佛发现:10种食物最能长肌肉,第一名多数人家里没有

今日养生之道
2026-08-09 09:38:49
威少宣布退役!在NBA打了18年一共赚到多少钱?退休金又有多少?

威少宣布退役!在NBA打了18年一共赚到多少钱?退休金又有多少?

锅子篮球
2026-08-13 09:35:20
我心中,他的十个瞬间

我心中,他的十个瞬间

圆方你怎么看啊
2026-08-12 19:06:28
入秋后,遇到这5种菜别手软,买上20斤,晒干后比新鲜的好吃10倍

入秋后,遇到这5种菜别手软,买上20斤,晒干后比新鲜的好吃10倍

阿龙美食记
2026-08-09 16:19:20
定了!今晚CCTV5+全程直播,中国男篮迎战乌拉圭

定了!今晚CCTV5+全程直播,中国男篮迎战乌拉圭

徐徐解说
2026-08-13 07:34:24
《亚伯拉罕协议》与沙土巴结盟:无心插柳助推伊斯兰世界百年愿景

《亚伯拉罕协议》与沙土巴结盟:无心插柳助推伊斯兰世界百年愿景

澎湃新闻
2026-08-12 16:20:31
为啥说百花奖已沦为“水奖”?看张艺谋发言就懂了,比票数还打脸

为啥说百花奖已沦为“水奖”?看张艺谋发言就懂了,比票数还打脸

古事寻踪记
2026-08-12 09:39:04
2026-08-13 18:24:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13746文章数 142718关注度
往期回顾 全部

科技要闻

DeepSeek V4 Pro更新:性价比炸裂 仍需打磨

头条要闻

女子虐待亲女儿致死入狱后父母断亲 绝食撞墙一心求死

头条要闻

女子虐待亲女儿致死入狱后父母断亲 绝食撞墙一心求死

体育要闻

负债十几亿的联赛,还在疯狂买球星

娱乐要闻

篡改红歌已立案,郭德纲大祸临头

财经要闻

可治疗癌症?神话破灭的片仔癀 陷入争议

汽车要闻

试了奇瑞捷豹路虎神行者8,才知道它的i-ATS有多强?

态度原创

手机
亲子
房产
艺术
公开课

手机要闻

曝小米阔折叠最快9月登场,档期与iPhone Ultra相近

亲子要闻

江苏女孩肛裂5年,大便不干不硬,真正问题竟在先天结构

房产要闻

投资暴跌90%!文昌楼市,正在停摆!

艺术要闻

于小冬 2026泽库写生新作

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版