网易首页 > 网易号 > 正文 申请入驻

把动作「画」给视频世界模型,跨本体双向推演,李飞飞参与

0
分享至

编辑|山辉


如果要让机械臂把咖啡机旁的杯子移到桌上,需要经历哪几个步骤?

在模型驱动规划中,它需要先生成多条候选动作,再交给世界模型预演,根据预演结果决定如何执行动作。

其中,视频世界模型通常会接收当前画面,以及关节角、末端位姿、夹爪状态等数值动作,生成执行动作后的未来视频。

可问题在于,对视觉模型来说,要建立某组数字和画面动作之间的对应关系,需要额外的学习。

并且这种学习依赖特定机器人产生的训练数据,换一台机器人,这些数据的结构还会全部改变。

既然视觉模型更熟悉画面,为什么不干脆把动作也「画」给它看?

近日,斯坦福大学、马里兰大学帕克分校和哈佛大学的研究团队发布论文《Masked Visual Actions for Unified World Modeling》。第一作者为 Hadi Alzayer,李飞飞、吴佳俊、张吕敏等研究者参与。

研究团队提出 Masked Visual Actions,将机器人的候选动作渲染成像素级运动轨迹,再让视频模型补全环境的响应,改变输入的实体后,同一个模型还能在两个方向上工作:

  • 给出机器人怎么动,预测环境会如何变化;
  • 给出目标物体怎么动,生成机器人可能采取的行为。



模型微调用了约 15 小时的机器人交互数据,同一个模型可以支持正向预测、逆向生成、多种机器人本体、策略评估和模型规划。在 RoboCasa 任务中,视频模型辅助规划带来了 7 至 26 个百分点的成功率提升;模型预测的策略表现与真实仿真结果达到 0.982 的相关系数;逆向动作提取管线在 CoffeeServeMug 任务上取得 90% 的成功率。



  • 论文标题:Masked Visual Actions for Unified World Modeling
  • 项目主页:https://masked-visual-actions.github.io/
  • 论文链接:https://arxiv.org/abs/2607.19343v1

翻译成视频就容易看懂了

视频世界模型直接预测未来图像或视频,常见工作方式可以概括为:当前图像+数值动作序列 → 未来视频。

数值动作能够精确控制机器人,却与视频模型熟悉的像素信息存在表示差异。

从一串动作数据到最终画面,中间还隔着多层转换:动作数据 → 机器人姿态 → 相机投影 → 画面运动 → 环境响应。

Masked Visual Actions 提前完成了这层转换。

训练数据通过两种方式构造。一种是直接从真实视频中分割机械臂,另一种是根据机器人状态、URDF 模型和相机参数渲染其运动。前者保留真实视觉信息,后者方便在推理时自由输入新的动作轨迹。

视频模型接收初始画面和这段机器人轨迹,再补全物体与环境的变化。



相比末端执行器点或机器人骨架,完整掩码还包含机器人的形状、占用空间、遮挡关系和潜在接触边界,模型能够直接「看」到动作过程。



这种表示也带来了更好的跨机器人本体泛化能力。

在 DROID 训练分布内,完整掩码、末端执行器位置和机器人骨架都能较好地控制视频生成,差距并不明显。



在训练分布内三种视觉条件表现接近

但当测试对象换成训练中未见过的自定义夹爪,或直接换成 BEHAVIOR 中的双臂机器人后,差距迅速拉开。



换成双臂机器人后,完整像素掩码对机器人形态的保持明显更稳定。

末端点和骨架只提供稀疏的运动信息,模型容易将新机器人改写成训练时见过的形态,甚至凭空生成另一台机器人;直接接收原始动作状态的 Ctrl-World,在双臂机器人上也容易生成静止或损坏的画面。

Masked Visual Actions 则直接给出新本体的完整轮廓与运动,因此能够较稳定地保留机器人形态,并继续预测它与环境的交互。

换句话说,不同机器人的关节数量、动作维度和控制方式可以完全不同,但进入视频模型后,都被转换成了同一种信息,这让跨机器人本体泛化成为可能。

两种填空方式,零样本切换逆向建模

在此之前,已经有一些尝试证明了「把 URDF 机器人渲染成掩码并用作视频模型条件」这一思路的可行性,

例如,BridgeV2W 将机器人动作渲染成像素对齐的本体掩码,再注入预训练视频模型。这种表示能缩小动作坐标空间与视频像素空间之间的差距,并支持不同机器人本体。

与之相比,Masked Visual Actions 把问题进一步抽象为:一段交互视频中,可以提供任意一部分实体的运动参考,再让模型补全其余实体。

用填空题类比,BridgeV2W 的题目基本固定为:已知机器人动作,填写环境部分。

Masked Visual Actions 则把它概括成:已知交互中的部分实体,填写剩余部分。

于是,模型获得了一种逆向使用方式:希望物体这样运动,机器人应该怎么动?



实际上,论文中的模型主要使用机器人掩码进行正向训练,推理时却能直接接收目标物体轨迹,零样本转向逆向建模。作者认为,这种能力来自视觉条件与视频模型内部表征之间的对齐。

在更完整的机器人系统中,这两种推理也许可以连续配合。

机器人接到 “把杯子放到桌上” 的任务后,逆向推理先提出可能的动作方案,正向模型再预演这些方案的结果,系统选择可靠轨迹并执行。完成一小段动作后,摄像头重新观察场景,再进入下一轮规划。


更少的数据,更彻底的接口统一

研究团队基于 Wan-Fun-Control 2.2 14B 进行 LoRA 微调,数据来自 DROID 真实机器人视频和 RoboCasa 仿真环境,包含成功与失败轨迹。

其中失败样本十分关键。世界模型需要学会错误动作会产生什么结果,否则它可能对每一条候选轨迹都生成一个看似成功的未来。

论文中还提到,模型微调使用了约 15 小时的机器人交互数据。

附录显示,训练数据约包括 1000 条 DROID 演示和 4000 条 RoboCasa 样本。模型使用 8 张 H200 训练约 10000 步,耗时 4 天。

这套系统依赖 14B 基础模型和较强硬件,整体并不轻量。

它的数据效率主要体现在不需要从头训练机器人世界模型,而是通过少量机器人样本激活视频模型已有的运动、接触与物体交互知识,并覆盖了多种能力:

  • 预测机器人动作产生的环境变化;
  • 根据目标物体运动生成机器人行为;
  • 适应训练中未出现的机器人本体;
  • 以及从生成视频中提取可执行行为等。

实验结果

实验中先由 Diffusion Policy 为同一场景采样多条候选动作后,视频模型生成对应未来,Gemini 3.1 Pro 再从任务进度、物理真实性和接触情况等方面评价每段视频,最后选择最优动作执行。

模型规划

在关闭微波炉、打开抽屉、打开洗碗机、关闭冰箱等任务中,加入视频模型规划后,成功率获得了7 至 26 个百分点的提升。候选数量增加时,整体表现也随之提高。



这相当于为机器人增加推理时计算:原有策略负责提出方案,视频模型负责预演,视觉语言模型负责筛选。策略参数保持不变,系统通过比较更多未来提高决策质量。

策略评估

作者将同一套机器人策略分别放进 RoboCasa 仿真环境和视频世界模型中执行。模型生成视频中的成功率,与真实仿真结果达到0.982的相关系数。



在真实机器人实验中,生成视频所体现的任务进度与实际演示也较为接近。模型仍然存在明显的乐观倾向,常常想象出比现实更多的任务进展。因此,它更适合作为策略开发早期的低成本筛查工具,距离替代仿真器和实机测试还有较大距离。

逆向动作提取

在 CoffeeServeMug 任务中,系统输入杯子的目标运动,视频模型生成机械臂完成操作的过程,逆动力学模型再提取可执行动作。完整管线取得 90% 的成功率,高于论文中对比的 Diffusion Policy、ACT 和 SmolVLA。



这里的 90% 来自 “视频模型+逆动力学模型” 的组合。视频模型提供行为过程,逆动力学模型负责把过程还原为控制数据。

总结

Masked Visual Actions 将机器人动作、环境响应和结果评价放入同一个视觉空间,并将正向预测与逆向生成统一为条件视频补全。

它也清楚地展示了视频模型在机器人系统中的一种分工方式:策略提出动作,视频模型预演未来,视觉语言模型评价结果,控制器完成实际执行。

现阶段,这套方法仍受到基础视频模型能力的限制。

模型学习的是交互相关性,缺少严格的因果与物理约束,仍会出现无接触运动、物体瞬移和任务结果凭空完成等现象。视频生成的速度和成本也限制了实时闭环控制。逆向流程还需要额外的逆动力学模型,最终执行始终依赖数值动作和底层控制器。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
不怕卡戴珊魔咒!新狼王爱德华兹霸气回应示好:我和软蛋不一样!

不怕卡戴珊魔咒!新狼王爱德华兹霸气回应示好:我和软蛋不一样!

绿茵八卦君
2026-07-23 18:35:03
广东队大调整,爆杜润旺后,又一位冠军球员也要离开,徐杰表态

广东队大调整,爆杜润旺后,又一位冠军球员也要离开,徐杰表态

宗介说体育
2026-07-23 14:34:53
高中住校还是走读?班主任含泪坦言:3年后,这两类孩子差距不小

高中住校还是走读?班主任含泪坦言:3年后,这两类孩子差距不小

户外阿毽
2026-07-23 16:15:58
医生提醒:血常规这3项有“箭头”,癌症可能已经上身了

医生提醒:血常规这3项有“箭头”,癌症可能已经上身了

健康之光
2026-07-23 15:10:07
别等自然解体!仁爱礁破船早已被菲方焊死礁盘,看懂这场长期博弈

别等自然解体!仁爱礁破船早已被菲方焊死礁盘,看懂这场长期博弈

行者聊官
2026-07-22 16:43:33
签下近百亿元大单!002353,“一字”涨停

签下近百亿元大单!002353,“一字”涨停

中国基金报
2026-07-23 10:24:38
《逐玉》长玉爸演员出事了!寇占文欠债遭法院悬赏…检举奖金惊人

《逐玉》长玉爸演员出事了!寇占文欠债遭法院悬赏…检举奖金惊人

ETtoday星光云
2026-07-23 16:27:09
惨了!U23国足抽进死亡之组,3大强敌围堵,安帅摆铁桶阵或能破局

惨了!U23国足抽进死亡之组,3大强敌围堵,安帅摆铁桶阵或能破局

萌兰聊个球
2026-07-23 14:12:43
一个大灯要价5万多!安联保险CEO批评车企只换不修:保费全让车主扛

一个大灯要价5万多!安联保险CEO批评车企只换不修:保费全让车主扛

快科技
2026-07-21 17:03:13
难怪被怀疑是张柏芝三胎生父,谢贤遗嘱曝光,这次王菲输的不冤

难怪被怀疑是张柏芝三胎生父,谢贤遗嘱曝光,这次王菲输的不冤

未来展望
2026-07-21 15:51:56
恭喜!中国女乒又一10岁新星崛起夺冠:王楠女儿止步32强内卷太猛

恭喜!中国女乒又一10岁新星崛起夺冠:王楠女儿止步32强内卷太猛

李喜林篮球绝杀
2026-07-22 17:52:49
王兴兴:做好准备迎接即将突破的技术临界点

王兴兴:做好准备迎接即将突破的技术临界点

极目新闻
2026-07-22 14:24:52
足球装备媒体:纳达尔身穿盗版阿迪球衣接受采访,而他是耐克赞助

足球装备媒体:纳达尔身穿盗版阿迪球衣接受采访,而他是耐克赞助

懂球帝
2026-07-23 13:31:31
父亲晒200万海归女儿,放话啥男孩才配,网友一句话戳破残酷现实

父亲晒200万海归女儿,放话啥男孩才配,网友一句话戳破残酷现实

阿郎娱乐
2026-07-22 09:58:39
中央气象台7月23日18时发布台风黄色预警

中央气象台7月23日18时发布台风黄色预警

界面新闻
2026-07-23 18:38:50
谢贤扶灵人员全部揭晓,名单藏着老港圈独有的相处情义

谢贤扶灵人员全部揭晓,名单藏着老港圈独有的相处情义

情感大头说说
2026-07-22 12:56:01
河南614分考生为保211,被西南交大智能建造录取,本人回应:要不要复读?

河南614分考生为保211,被西南交大智能建造录取,本人回应:要不要复读?

育学笔谈
2026-07-23 14:52:31
贪官末日来了!中央反腐新规已落地,无论在职退休一律终身追责

贪官末日来了!中央反腐新规已落地,无论在职退休一律终身追责

职场资深秘书
2026-07-22 18:44:56
中国人民解放军浙江省温州军分区

中国人民解放军浙江省温州军分区

音乐时光的娱乐
2026-07-23 16:36:43
《复仇者联盟5》24小时观看超5亿 已超越《GTA6》

《复仇者联盟5》24小时观看超5亿 已超越《GTA6》

3DM游戏
2026-07-23 09:06:10
2026-07-23 21:20:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13588文章数 142698关注度
往期回顾 全部

科技要闻

梁文锋:DeepSeek不争超级App,只押注AGI

头条要闻

马犬被洪水冲走十余天后自行回家瘦了30多斤 主人发声

头条要闻

马犬被洪水冲走十余天后自行回家瘦了30多斤 主人发声

体育要闻

勇士24岁的MVP,也是个勒布朗?

娱乐要闻

梁朝伟汤唯19年后境遇反转

财经要闻

梁文锋当不成赛博圣人

汽车要闻

领克07GT正式上市14.58万起 把纯粹驾趣还给旅行

态度原创

时尚
本地
旅游
亲子
手机

今年夏天最流行的5组搭配,谁穿谁时髦!

本地新闻

跟着影视去旅行:西游篇

旅游要闻

夏日出逃!躲进22°清凉环线,赴金寨山水治愈之旅

亲子要闻

男童夏季套装韩版时髦1

手机要闻

手机涨价可能会持续两三年 网友:不换了

无障碍浏览 进入关怀版