网易首页 > 网易号 > 正文 申请入驻

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

0
分享至


视觉轨迹充当“同声传译”,让世界模型和机器人动作真正“同频对话”。

作者丨幸丽娟

编辑丨岑 峰

日前,一篇叫做《TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks》的论文悄然上线 arXiv。论文署名中出现了两个大家很熟悉的名字——李飞飞、吴佳俊。


论文链接:https://arxiv.org/html/2608.24101v1

熟悉具身智能圈的人都知道,这两个名字放在一起,分量不轻。

李飞飞是世界模型“空间智能”方向的旗帜人物,而刚刚领完 IJCAI 2026 计算机与思想奖的吴佳俊,则是这一领域最核心的研究者之一。

这两位长期合作的学术战友,最近在具身智能领域动作频频。就在一个月前,他们刚与 ControlNet 作者张吕敏等十余位学者共同发表了《Masked Visual Actions for Unified World Modeling》,把机器人动作渲染成像素轨迹,喂给视频世界模型。

但对于他们而言,之前的尝试或许还不够彻底。

世界模型能看懂机器人动作了,但机器人动作那一侧的问题还卡着:动作怎么实时变成轨迹?世界模型预演完,怎么反过来帮机器人挑动作?

这条往返的路,还没有打通。

这一次,他们直指这个问题的核心:机器人的“动作控制”和世界模型的“预测画面”,说的根本不是同一种语言。

TrAct 的解法,就是在中间配一位“同声传译”。


01

世界模型的“巴别塔”:动作和像素,鸡同鸭讲

先解释一下背景。

现在具身智能行业正在形成一种共识:光靠 VLA“条件反射”式地输出动作不够,得让机器人学会“先在脑子里过一遍”——多个候选动作,交给世界模型预演未来,再挑结果最好的执行。

π0.5、GR00T 这些头部 VLA 模型,在标准基准上已经刷到接近满分。但在真实世界的泛化中,它们依然频频翻车。

因此,世界模型的“预演”能力,被普遍认为是具身智能的下一个关键拼图。

但问题是,“预演”这出戏,主演对不上台词。

机器人控制器输出的是一串低维的“动作方言”:可能是末端位姿,可能是关节角,可能是夹爪开合,也可能三者组合——十几或二十个低维数字。

世界模型需要输出的是高维的“像素画面”:夹爪在画面中的像素坐标、轮廓形状、与物体的距离;面条在每一帧中如何弯曲、滑动、与碗壁碰撞。每一帧可能是 224×224×3 ≈ 15 万像素,16 帧就是 240 万像素。

问题来了:20 个数字怎么推导出 240 万个像素?

从“末端位姿变化 0.02 米”到“夹爪在画面中向右移动了 50 个像素”,中间隔着一整条物理因果链——关节转动、末端接触、物体滑动、相机成像。把前者直接喂给后者,等于给导演看剧本大纲里的 20 个关键词,让他脑补出两个小时的电影。

世界模型就是在硬着头皮干这个"脑补"的活儿。 论文将这种方案称为AWM(Action-conditioned World Model,动作条件世界模型) ——给定动作指令,直接预测未来画面。

不意外的是,这套"硬猜硬译"的方案,翻车姿势非常典型:

夹爪姿态预测错了;背景和目标物体在预测画面里凭空消失;两个相机视角对同一物体的位置判断互相打架。

更要命的是,每一种机器人的“动作方言”都不一样。 Franka 说 Franka 语(末端位姿+夹爪开合),UR5 说 UR5 语(另一套关节参数),双臂机器人又说第三套。

同样是“把面条放进碗里”,每台机器人“念出来的台词”完全不同。

也就是说,换一台机器人,之前学的"动作到画面"的映射几乎作废——跨本体泛化,就成了行业公认的死结。

一边是机器人执行不了的像素,一边是世界模型看不懂的动作。

TrAct 的答案:请一位“同声传译”,把两边的话翻译成彼此都懂的语言。

这位“同声传译”,叫做视觉轨迹(visual track)。


02

TrAct :让视觉轨迹当“同声传译”

视觉轨迹是什么?一句话:具身无关而任务相关的关键点,在图像坐标里随时间移动的路径。

TrAct 会跟踪两类点:

1.夹爪点:机械臂夹爪上的 7 个固定网格顶点,覆盖夹爪的轮廓和运动范围——解决“手怎么动”;

2.场景点:图像平面上 5×5 均匀网格采样的 25 个点,分散在整个画面——解决“环境怎么动”(物体滑动、相机晃动)。

这两类点的分工很明确: 夹爪点是“主动运动”的源头,直接反映机器人的动作意图;网格点是“被动运动”的参照,帮助模型判断画面变化是来自夹爪移动、物体滑动,还是镜头晃动。两者结合,世界模型才能准确理解“哪些像素动、为什么动”。

这套语言妙就妙在“通用”:不管 Franka、UR5 还是人手,把物体放进碗里这个动作,翻译成轨迹都是同一句话——“夹爪关键点沿这条路径移动,物体从当前位置进入碗的区域”。动作带着本体特异性,轨迹却是跨本体的“普通话”。


围绕这个接口,TrAct 搭了一个“剧组”,三个阶段、三个组别分工明确:

VLAT(Vision-Language-Action-and-Track model),出方案的导演组。

在预训练 flow-matching VLA π0.5 的基础上改造动作头,让它同时输出动作块对应的轨迹块。

  • 动作块a是“方言”——末端位姿、关节角、夹爪开合,这些低维的机器人指令;

  • 轨迹块τ是“普通话”——任务相关关键点在图像坐标系中的运动路径。

两者必须严格成对: 每一组候选方案里,动作和轨迹来自同一次策略采样,不能拆开自由组合。这是贯穿全文的一条红线——预演条件是轨迹,执行控制是动作,两者必须对应同一套方案。如果轨迹描绘出一个美好的未来,配对的执行动作却实现不了这条轨迹,预演就成了“自我感动”。

训练时,VLAT同时优化两个流匹配损失:动作损失监督“方言怎么说”,保证指令可执行;轨迹损失监督“普通话怎么写”,保证轨迹准确描述了画面里点的运动轨迹。换句话说,导演组既要把戏排出来(动作),又要把分镜画清楚(轨迹),两条线同时推进。

TWM(Track-conditioned World Model),预演的拍摄组。

分镜画好了,谁来把它变成成片画面?拍摄组上场。

TWM以 Stable Video Diffusion(SVD)为视频生成骨干,增加了一个 Temporal ControlNet 分支,专门把轨迹坐标渲染成空间控制图。智能体视角(agent-view)的轨迹走红色通道,腕部视角(wrist-view)走蓝色通道——两个视角共享时间线,各自保留独立的“机位”。

有了轨迹这个普通话版的“分镜脚本”,世界模型的工作方式彻底变了:

之前(AWM)是“给一串方言,硬猜画面”:给定末端位姿变化0.02米,模型得自己脑补“这会导致夹爪在画面中向右移动50个像素、同时把面条推出去、碗的遮挡关系发生变化……”——整条物理因果链全靠硬猜。

现在(TWM)是“给一段普通话,按脚本渲染画面”:已知关键点从A位置移动到B位置、物体从P点滑到Q点,把对应的像素生成出来就行。

从“因果推理”变成了“条件渲染”,难度降了一个维度。 拍摄组不需要理解“关节转了30度会怎样”,只需要按照分镜把画面拍出来。

VLAC(Vision-Language Reward Model),拍板的审片人。

画面拍出来了,谁来定稿?审片人。

VLAC基于 InternVL2 的视觉语言奖励模型,对每条预演视频按任务指令打分。但它评的不是“画质清不清晰”,而是“任务完成了没有”——面条进碗了吗?夹爪够到目标了吗?关柜门关严了吗?

审片人只看剧情对不对得上剧本。哪怕样片画质有点糊,只要动作做对了,VLAC就给高分;反之,画面再逼真、动作跑偏了,照样不及格。


推理时,三个角色是这么协作的:

1.导演组出方案:每个决策点,VLAT用TSR(Temperature-Scaled Resampling,温度缩放重采样) 生成K个候选动作-轨迹对(仿真K=20,真机K=16)。

2.拍摄组拍画面:TWM拿着每个候选方案里的轨迹,逐一生成预演视频。

3.审片人打分:VLAC对每条预演视频按任务指令打分,选出得分最高的那一条。

4.执行:把那条高分样片对应的动作交给机器人执行。

选中的永远是同一对(a,τ)——预演条件与执行控制来自同一次策略采样。“想得到”(轨迹预演)和“做得到”(动作执行)被绑定,减少中间的信息传递失真。


03

数据引擎:没有动作标签的人类视频,也能“重用”

这套接口的另一重红利,来自于数据侧。

机器人数据贵得离谱,而互联网上人类第一视角操作视频近乎无限——但人类视频没有机器人动作标注,传统 VLA 拿它们没什么办法。

轨迹接口绕开了这堵墙:人类视频虽然给不了“机器人这段方言怎么说”,但完全能给得出“这段画面的分镜脚本长什么样”。

于是 TrAct 的预训练配方是:76K 条 DROID 机器人遥操作数据 + 约 150K 条 EgoDex 人类第一视角操作视频(约占完整 EgoDex 的一半),按 1:2 混合。

DROID 的夹爪 7 点、EgoDex 每只手 7 点加 25 个背景网格点,全部统一映射进同一套轨迹槽位布局——缺失的相机、操控器和轨迹槽位全部用掩码处理。

这意味着什么?人类视频终于不用“翻译成动作”,就能直接参与机器人模型的预训练。

背后的逻辑很清楚:视觉运动是可以跨具身共享的监督信号,而且这个信号的供给几乎是无限的。 人类视频的量级,是机器人遥操作数据永远追不上的。这就让 TrAct 在预训练阶段获得了远超纯机器人数据的运动先验。

数据规模和跨具身通用性,两者在这个接口下被同时激活了。


04

更严酷的考场,更硬核的物理测试

▎仿真基准:LIBERO-INTEGRAL 上全面领先

先说基准。标准 LIBERO 上,各家模型的表现已经接近天花板——π0.5 平均 96.8%,TrAct 98.3%,差距不到 2 个点,说明刷榜刷不出区分度。


于是团队自建了一个更严酷的考场——LIBERO-INTEGRAL,共 20 个任务:

  • 10 个鲁棒性任务:涵盖物体互换(Swap)、物体变化(Object)、任务变化(Task)、相机视角变化(Camera)、机器人初始位姿变化(RobotInit),各 2 个,全部取 LIBERO-Plus 最难档位;

  • 10 个跨具身任务:把场景里的 Franka Panda 直接换成 UR5,任务规范和场景配置保持不变。

“考生”包括四种策略变体:

  • π0.5:基线 VLA 策略

  • VLAT:联合预测视觉轨迹和可执行动作,无动作选择

  • TrAct:完整框架,包含轨迹条件世界模型动作选择

  • VLAT+AWM:用动作条件替代轨迹条件

换到 LIBERO-INTEGRAL这个考场,差距瞬间拉开

• π0.5 平均成功率27%,其中任务变化 15%、跨本体 17%——“换任务”、“换机器人”恰好是其表现最惨的两项,而这正是机器人动作执行的痛点所在;

• VLAT(加轨迹头但不做预演)平均成功率是 44%;

• VLAT+AWM(用动作条件世界模型做预演)平均成功率是 49%;

TrAct 拿下 55%的成功率,比 π0.5 翻了一倍还多,比同样做预演的动作条件版本再高 6 个点。

逐类别看,TrAct 在 Swap 65%、Object 60%、Task 50%、Camera 60%、RobotInit 65%、跨本体 50%,六项全部领先;20 个任务里 18 个拿到最佳或并列最佳。


跨本体任务的细节更能说明问题:

UR5 版“把橙汁放进篮子”,π0.5 成功率 0.0,TrAct 拉到50%;

“把碗放到盘子上”,π0.5 成功率 40%,TrAct 拉到 80%。

当然也有翻车的——“拿番茄酱进篮子”,π0.5 是 0.0,TrAct 也只有 10%。团队没有回避这一点:难任务依然难。


统计显著性也做了确认:三种随机种子的评估中,TrAct 平均 0.547(95% 置信区间 [0.53, 0.56]),VLAT+AWM 平均 0.490([0.47, 0.51]),两个置信区间完全不重叠——改进是真实的,不是抽签抽出来的

▎视频预演质量:有“分镜”的,碾压没“分镜”的

再看世界模型的视频预演质量本身。论文比较了 TWM(轨迹条件,有分镜) 与 AWM(动作条件,没分镜)在仿真和真实两个场景、智能体和腕部两个视角下,在五个标准视频质量指标上的表现:

PSNR:峰值信噪比,越高越好; SSIM:结构相似性指数,越高越好; LPIPS:学习感知图像块相似度,越低越好; FID:弗雷歇起始距离,越低越好; FVD:弗雷歇视频距离,越低越好;

结果,轨迹条件(TWM)对动作条件(AWM)是全指标碾压。

差距最悬殊的是仿真 + 智能体视角这一配置:TWM 比 AWM, PSNR 高出 62%,SSIM 高出 75%,LPIPS 低了 76%, FID 低37%,FVD 低 70%。

真实世界腕部视角同样悬殊:TWM 比 AWM,PSNR高出 22% ;SSIM 高出 19% ;LPIPS 低 40% ;FID 从 176 降至 130,低 26% ;FVD 低 43% 。

两个场景、两个视角、五个指标,TWM 无一例外全部领先。

也就是说,有“分镜”的比没“分镜”的预演画面,质量高出一个维度。把“动作方言”翻译成“轨迹普通话”再预演,比从动作指令硬猜画面,准得多。

▎更硬核的物理机器人实验:继续遥遥领先

仿真里的成功还不够。团队把 TrAct 搬到了真实的 Franka Panda 机器人上,看看它在物理世界里到底扛不扛得住。

机器人配备了两个 RGB 相机——一个从第三方视角看着整个桌面,一个装在夹爪上近距离盯着操作区域。训练数据只有 400 条 15Hz 的演示,覆盖了 4 个基础任务;测试则是 5 个训练时从没见过的任务:

1.将半长粉色面条放入碗中;

2.将热狗面包放入碗中;

3.将绿色砖块放入碗中;

4.关闭部分打开的右柜门;

5.将倾斜勺中的意大利面倒入锅中。

每个任务 10 个 episode,而且不仅要过常规背景这一关,还要在换了桌面背景的陌生环境下再跑一遍——看看它会不会被“换了个桌布”就搞懵。


最终平均成功率:π0.5 是 49%,加上 VLAC 评委直接打分是 65%,VLAT+AWM 是 66%,TrAct 是 76%。

两个任务的细节值得单独拎出来说。


一个是“关右边的柜门”——五个任务里唯一接触密集型的,最能拷打预演精度。

常规背景下,π0.5 只有 50%,VLAT+AWM 也才 60%,TrAct 做到 80%;

换到陌生背景下,动作条件版本直接掉到40%,TrAct 反而稳在 70%。

这就说明,域偏移越大,轨迹接口的优势越明显。因为轨迹描述的是"画面里该怎么动",天然不依赖具体背景长什么样。

另一个是“半根粉色面条放进碗里”,TrAct 在常规背景下拿到了满分。机器臂夹着一段训练时没见过的、更短的面条,稳稳放进碗里。泛化能力,同样肉眼可见。

更大规模的预训练变体TrAct+(76K DROID + 60K BridgeData V2 + 完整 30 万级 EgoDex,8 块 H100 跑 60K 步),也把五个最难的 UR5 任务从 π0.5 的 6%、TrAct 的 32% 进一步拉升到 38%。


这也进一步论证了,接口红利之外,数据规模红利依然在兑现。


05

TrAct 对具身智能行业的意义

回过头来看,TrAct 真正的贡献,并不在于它刷新了 SOTA,而是“接口层”的统一:

以前,动作是世界模型的输入。你给 Franka 语它就学 Franka,给 UR5 语它就学 UR5——换台机器人,推倒重来。

现在,机器人动作和世界模型预测之间有了统一的翻译层。机器人输出动作(方言),轨迹把它翻译成“画面里的点怎么动”(普通话),世界模型拿着翻译结果做预测。

机器人动作和世界模型“鸡同鸭讲”的行业困局,第一次得到系统性的破局。

但硬币的另一面同样清晰,论文自己也交代得明白:

第一,TrAct 不是物理模拟器。轨迹是二维图像空间的点运动,不显式建模力、碰撞和接触状态;它预测的是"看起来会发生什么",不保证“物理上一定发生什么”。

第二,预演的可靠性最终依赖 VLAT 的轨迹预测质量。如果动作本身不可靠,轨迹和动作可能一起错,高分预演不等于安全执行。

第三,它不便宜,每个决策点要跑十几次视频生成和打分,推理成本是真金白银。雷峰网雷峰网雷峰网

第四,真机数据也还是少了点:400 条演示,5 个评测任务,离工业级场景的验证还有距离。

在整个行业都在苦寻大模型如何驱动机器人的当下,大家都在问同一个根本问题:世界模型和机器人之间,到底该用什么语言对话。

TrAct 交出了一份极具启发性的答卷。它证明了,肉眼可见的视觉轨迹,可以成为这一通用的语言。

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」?

  • 会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航:场馆分布、报告厅怎么走,群里随时问;

    议题共读:热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编:现场海报精华整理,一键收藏不遗漏;

    约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

? 进群传送门:扫码进群或添加微信Qvv0909777,备注:IJCAI+ 单位/学校+姓名+方向

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
你以为日本怕朝鲜,怕的是那几枚导弹?错了。日本真正睡不好觉的,不是射程,而是平壤压根不跟你玩

你以为日本怕朝鲜,怕的是那几枚导弹?错了。日本真正睡不好觉的,不是射程,而是平壤压根不跟你玩

人生录
2026-08-31 00:05:12
随着郑钦文2 1击败柳托娃,产生5个不容置疑的事实,决胜盘确实厉害

随着郑钦文2 1击败柳托娃,产生5个不容置疑的事实,决胜盘确实厉害

跨界观察日记
2026-09-01 02:38:50
最低调普京女婿被亿万富豪当街暴打:拒绝10亿赔偿,只提一个要求

最低调普京女婿被亿万富豪当街暴打:拒绝10亿赔偿,只提一个要求

刀刃故事
2024-11-11 10:40:21
比亚迪“庞然大物”来了,售价比预估低,车内舒适像商务车!

比亚迪“庞然大物”来了,售价比预估低,车内舒适像商务车!

米粒说车唯一呀
2026-09-01 13:45:21
全新大众途锐,售价跳水,关注度飙升,卡宴同款底盘动力很有诚意

全新大众途锐,售价跳水,关注度飙升,卡宴同款底盘动力很有诚意

小怪吃美食
2026-09-01 09:58:58
演员王鸥承认单身生子:我目前独自养育一个孩子,孩子尚且年幼,希望大家不要过度聚焦私人生活,留给小朋友一片可以自在成长的安静空间

演员王鸥承认单身生子:我目前独自养育一个孩子,孩子尚且年幼,希望大家不要过度聚焦私人生活,留给小朋友一片可以自在成长的安静空间

扬子晚报
2026-08-31 17:16:22
巴萨U15公布23人名单:李昊炎与7名西班牙国少新星并列!

巴萨U15公布23人名单:李昊炎与7名西班牙国少新星并列!

邱泽云
2026-09-01 15:13:48
中国国防部已发出重磅通知!8月27日下午,国防部发言人正告:赖清德当局"肆意挥霍民脂民膏、穷兵黩武,终将掏空台湾家底,难逃败亡结局"

中国国防部已发出重磅通知!8月27日下午,国防部发言人正告:赖清德当局"肆意挥霍民脂民膏、穷兵黩武,终将掏空台湾家底,难逃败亡结局"

扶苏聊历史
2026-08-31 13:55:25
十年内, 癌症将在澳洲彻底消失! 四期癌症清零, 医学奇迹震撼全球!

十年内, 癌症将在澳洲彻底消失! 四期癌症清零, 医学奇迹震撼全球!

澳微Daily
2026-08-29 16:01:21
刘亦菲67岁母亲近照曝光!大腹便便体态臃肿,气质却非常优雅

刘亦菲67岁母亲近照曝光!大腹便便体态臃肿,气质却非常优雅

娱说瑜悦
2026-08-30 21:25:17
后续:黑客攻击孙宇晨,景甜、孙宇晨的“秘密藏不住了”!

后续:黑客攻击孙宇晨,景甜、孙宇晨的“秘密藏不住了”!

默默有话说
2026-09-01 14:42:13
景甜的身材有多好?看她的健身照就知道了!

景甜的身材有多好?看她的健身照就知道了!

小方说跑步
2026-08-28 17:41:25
iOS 27 更新,很丝滑

iOS 27 更新,很丝滑

果粉俱乐部
2026-09-01 14:15:57
中日交涉谈崩后,在紧急时刻,日本官宣重大决定,中方捅破窗户纸

中日交涉谈崩后,在紧急时刻,日本官宣重大决定,中方捅破窗户纸

小嵩
2026-09-01 13:20:54
勒庞决选通杀,亲华候选人只剩2%支持率,法国要彻底变天了

勒庞决选通杀,亲华候选人只剩2%支持率,法国要彻底变天了

简史笔记
2026-09-01 13:39:13
搞笑的俄罗斯议员!克里姆林宫真急了:狂轰滥炸背后的恐惧

搞笑的俄罗斯议员!克里姆林宫真急了:狂轰滥炸背后的恐惧

鹰眼Defence
2026-08-31 16:53:42
马斯克预言成真?大陆第二大王牌曝光,美媒:比“稀土”更可怕

马斯克预言成真?大陆第二大王牌曝光,美媒:比“稀土”更可怕

谷盟1
2026-08-30 16:00:37
美国“国家海滩日” 众女星晒比基尼美照

美国“国家海滩日” 众女星晒比基尼美照

乡野小珥
2026-09-01 09:03:30
不是景甜舍不得3000万,查了下才知道,原来她穷得日子也不好过

不是景甜舍不得3000万,查了下才知道,原来她穷得日子也不好过

天天热点见闻
2026-08-29 08:53:35
哈里王子给自己起了一个新的四字头衔引发愤怒:绝不可能

哈里王子给自己起了一个新的四字头衔引发愤怒:绝不可能

手工制作阿歼
2026-09-01 02:19:18
2026-09-01 17:27:00
雷峰网 incentive-icons
雷峰网
关注智能与未来!
70763文章数 656223关注度
往期回顾 全部

科技要闻

OpenClaw最大更新,新用户很爽 老用户翻车

头条要闻

00后情侣连住酒店145天客房成垃圾场 还拒绝保洁打扫

头条要闻

00后情侣连住酒店145天客房成垃圾场 还拒绝保洁打扫

体育要闻

大爹杨瀚森,让中国男篮有了容错空间

娱乐要闻

孙宇晨破防,他无法接受孙割这个名字

财经要闻

库克卸任,苹果下一个增长点在哪?

汽车要闻

AI读懂时间/智驾迈入4D时空 小鹏第二代VLA完成重大升级

态度原创

旅游
本地
时尚
公开课
军事航空

旅游要闻

176项活动!青岛9月文旅菜单出炉 承包你的整个秋天

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

裙子这样搭外套,能美一整个秋天

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

特朗普:不会对伊朗用核武器

无障碍浏览 进入关怀版