网易首页 > 网易号 > 正文 申请入驻

清华联合伯克利提出连续世界模型,机器人不用再逐帧猜环境

0
分享至

来源:市场资讯

(来源:DeepTech深科技)


在具身智能的演进中,世界模型被寄予厚望:它不仅要生成未来画面,更要帮助机器人理解世界如何连续变化。然而,当前主流的视频生成与部分机器人世界模型,它们的底层架构大多仍受制于一个固有的思维定式:离散的下一步预测(Discrete Next-step Prediction)。

简单来说,这种模式将连续的物理世界切分成了一帧帧静态的画面。AI 预测未来时,必须像翻连环画一样,根据当前帧去推演下一帧。这种方式在短时间的视觉生成上大放异彩,但面对长视距的物理任务时,却暴露出明显缺陷:由于误差会逐帧累积,时间一长,AI 就容易偏离原本的物理规律,产生不合逻辑的幻觉。

近日,清华大学智能产业研究院(AIR)与加州大学伯克利分校(BAIR)团队合作提出了一种全新的预测范式 ODEWorld,其建立在连续的“物理时间流”(Physical-Time Flow, PT-Flow)之上。与传统方法直接预测下一帧是什么不同,ODEWorld 试图学习的是:世界究竟怎样从当前状态连续地变化到未来状态。


图 | 连续世界模型概念(来源:受访者提供)

实验中,当研究人员把模型预测出的连续中间状态用于指导机器人后,四项真机任务的平均成功率从 55% 提高到了 80%。

谈起这项研究的出发点,论文共同一作刘东岫告诉 DeepTech,“真实世界是连续变化的,机器人要理解世界怎样运动,其中速度是一个很重要的变量。看到一个物体运动,我们既要知道它往哪个方向走,也要知道它运动得有多快。传统的离散帧世界模型很难直接表达这些信息。”

世界模型,究竟是在“理解”还是“模拟”世界?

在讨论这项成果之前,我们需要先回答一个更基本的问题:今天被统称为“世界模型”的技术,究竟在做什么?

视频生成、三维世界建模、通过预测未来帮助机器人决策,以及让机器人进入虚拟环境训练,这些不同方向如今都可能被称为世界模型。但刘东岫认为,它们实际上可以进一步拆成两类目标:理解世界和模拟世界。

所谓“模拟”,是尽可能准确地复现真实环境。如果要让机器人进入一个虚拟世界进行大规模训练和测试,场景、物体以及各种视觉细节都需要足够逼真。在这条路线上,世界模型更像一个高仿真的模拟器。

“理解”解决的则是另一类问题。机器人看到一段人的操作视频,需要知道其中发生了什么;进入一个场景,需要识别物体在哪里、它们之间是什么关系,以及这些状态正在怎样变化,再把这些信息交给下游动作模型。

两者对模型提出的要求并不相同。模拟追求尽量还原现实,而理解并不要求保留每一个像素。相反,大量背景、纹理和视觉细节对于机器人当前的动作可能并不重要,模型需要把复杂视觉信息压缩下来,留下真正与状态和变化相关的部分。

“理解这件事情,本质上需要压缩。”他说,“我们希望找到一种更加自然、更接近本质的世界表征,再用这个表征指导机器人执行动作。”

按照这一划分,ODEWorld 更接近“理解”这条路线。对团队而言,问题不仅是把视觉信息压缩得更小,更重要的是:压缩之后,究竟应该保留什么。

他们认为,其中一个关键就是世界的动态变化。机器人不仅要知道场景里有什么、物体在哪里,还要理解物体正在怎样运动,以及这些状态如何随时间发生变化。

但现有视觉世界模型通常沿用视频本身的离散形式,根据当前帧预测下一帧。问题在于,视频虽然是一帧帧记录的,真实世界却始终连续变化。摄像头拍下的只是一个个时间切片,两帧之间,机械臂仍在移动,物体的位置、方向和速度也在不断变化。

因此,在刘东岫看来,仅仅压缩视觉信息还不够,模型还需要把这种连续变化本身表示出来。“传统的一些世界模型,是通过预测下一帧图片来理解世界。如果下一帧预测得很好,就认为机器人理解了世界怎么变化。但我们想做的是,不仅要知道下一帧是什么,还要让机器人理解它是怎么从这一帧变到下一帧的。”

除此之外,真实机器人采集到的视频也并不总是严格均匀。不同设备可能具有不同帧率,即便标称相同,传感器实际采样时间也可能出现误差或掉帧。离散模型往往弱化了这些真实的时间差异。

于是,ODEWorld 试图把“物理时间”重新带回世界模型:它关心的不再只是下一张画面是什么,而是此刻的世界正在朝什么方向、以怎样的速度变化?


图 | 生成效果(来源:受访者提供)

不再一帧帧猜,而是学习“世界往哪里走”

为了解决这一问题,研究团队提出了物理时间流(PT-Flow)。它不再直接学习这一帧之后是哪一帧,而是把世界的变化表示成一个随真实时间连续演化的过程。

第一步,是先把复杂的视觉信息压缩下来。

ODEWorld 使用预训练的 DINOv2 提取图像特征,再进一步把真正随时间变化的信息压缩到一个更小的空间中。原因在于,一张图片里包含大量背景、纹理等信息,但这些内容并不都与物体如何运动有关。

刘东岫认为,这种压缩对于面向机器人的世界模型尤其重要。“机器人最后要部署到真实世界,它不可能带着大量显卡支撑计算,因此必须高效压缩世界表征。”模型真正需要留下的,不是所有像素细节,而是有用的动态信息,也就是对世界变化本身的理解。

为此,团队设计了动态表征解耦,把相对稳定的背景和初始状态,与随时间不断变化的动态信息尽量分开,让模型集中表示什么发生了变化。同时,通过图像重建进行约束,保证压缩后的信息没有丢掉理解当前场景所必需的内容。

这种设计还试图解决隐空间世界模型中一个常见问题——表征坍塌(representation collapse)。

简单来说,如果压缩过头,不同画面、不同动作阶段可能最终都被模型表示成几乎一样的状态。刘东岫把这种情况形容为模型“摆烂了”:无论看到什么,都输出差不多的东西。这样虽然预测变得容易,但模型也失去了真正区分世界状态的能力。

ODEWorld 的做法,是把“保留状态信息”和“预测未来变化”拆开监督:一方面通过重建保证压缩后的表征仍然包含足够信息,另一方面专门学习这些状态如何随时间变化。论文的表征分析也显示,这种方式能够明显降低坍塌风险。

接下来是 PT-Flow 最关键的一步:学习世界变化的方向和速度。

虽然训练数据仍然是一帧帧图片,但相邻画面之间有真实的时间间隔。团队先从这些观测中估计变化速度,再通过 JVP(Jacobian-vector product,雅可比向量积)把图像层面的变化映射到压缩空间,得到更连续、平滑的动态变化,并让模型直接学习这种变化规律。

这样,ODEWorld 学到的就不再只是“A 之后是 B”,而是从 A 到 B 之间的状态怎样连续变化。

预测时,模型从当前状态出发,通过普通微分方程(ODE)求解器把每一刻的变化不断累积起来,因此可以得到未来任意时间点的状态。原本两帧之间没有被拍下来的时刻,也可以沿着这条连续轨迹推演出来。


图 | 任意时间分辨率生成(来源:受访者提供)

刘东岫举例说,如果数据集中前后两帧相隔 0.1 秒,ODEWorld 可以进一步预测 0.01 秒、0.05 秒等中间时刻的状态,并呈现连续的变化趋势。

同一套连续轨迹还可以反向求解。在不额外训练新模型的情况下,改变积分方向,ODEWorld 就可以从当前状态向过去反推。刘东岫将这一实验视为对模型连续性的一项验证:它不是简单把已有视频倒放,而是沿着模型学到的变化规律反向推演。


图 | 反向生成(来源:受访者提供)

这种在紧凑空间中预测的方式也带来了较高的计算效率。64 帧长程视频预测实验中,ODEWorld 在单张 A100 GPU 上的预测延迟为 0.072 秒,而 V-JEPA 2 和 LDP 分别为 0.619 秒和 3.953 秒。

预测速度提高的同时,画面质量也保持了较好的水平。在 64 帧长程预测中,ODEWorld 的 PSNR 达到 19.46(数值越高,说明预测画面与真实画面在像素上越接近),高于 V-JEPA 2 的 16.47 和 LDP 的 16.27;感知相似度指标 LPIPS 为 0.134(数值越低,说明看起来越自然、越接近真实),也优于另外两种方法。

因此,PT-Flow 改变的并不只是能否补出更多中间画面,而是世界模型描述变化的方式:传统方法主要学习“A 之后是什么”,ODEWorld 则进一步尝试学习“A 是怎样连续走到 B 的”。

从预测未来,到指导机器人行动

连续建模是否有价值,最终还要回到机器人任务本身:它能不能帮助机器人把动作做得更好?

为此,研究团队没有把 ODEWorld 生成的未来画面直接交给机器人,而是利用模型学到的连续轨迹,在当前状态和任务目标之间生成一系列中间状态,也就是隐空间子目标(latent subgoals)。

可以把它理解为给机器人增加了一组“中途路标”。例如完成插笔任务,机器人不能从“拿着笔”直接跳到“笔已经插进笔筒”,中间还要经历靠近笔筒、调整位置、对准开口、逐渐插入等多个阶段。ODEWorld 根据学到的世界变化规律预测这些中间状态,再把它们提供给下游动作模型,帮助机器人判断下一步应该朝哪里行动。

论文分别测试了速度信息、单个中间目标和连续多个中间目标三种指导方式。其中,连续提供多个子目标的效果最好。在 LIBERO-LONG 的 10 项长程操作任务中,这一方案平均成功率达到 83.6%。

研究团队随后将方法部署到真实双臂机器人上,测试夹虾入锅、鼠标收纳、插笔和双臂整理物体等 4 项任务。在底层 X-VLA 动作模型保持一致的情况下,加入 ODEWorld 提供的连续中间目标后,4 项任务的平均成功率从 55% 提高到 80%。

这组实验表明,ODEWorld 学到的连续变化信息不仅能够用于预测未来,也能够进一步转化为机器人执行任务时可以利用的指导信号。

刘东岫更期待的一个变化,是提高机器人学习新任务的数据效率。

机器人领域真正带有动作标注的数据仍然有限。如果世界模型能够先从更多图像和视频中学习世界如何变化,再把这种能力迁移给下游策略模型,就有机会减少每一个具体任务需要的机器人操作数据。

刘东岫表示,团队后续也希望继续推进 scaling,使这类世界模型逐渐成为更通用的上游模型,再通过较少的下游数据适配具体机器人任务,提高真实执行的准确率。

不过,ODEWorld 目前解决的仍然只是物理世界建模中的一部分问题。真实世界除了时间上的连续变化,还存在接触、碰撞、摩擦和力等更加复杂的物理规律。当前 ODEWorld 并没有对这些因素进行建模。

刘东岫也并不把连续时间视作世界模型的最终答案。“我们不会说它就是终局。”在他的判断中,未来更完整的方向应该是物理世界模型,而连续时间会是其中一个重要组成部分。

1.https://dstate.github.io/odeworld_website/

2.https://arxiv.org/abs/2607.27924

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
提车3小时就返4S店维修!7大车圈高管炮轰速成车乱象:消费者不能成试车员

提车3小时就返4S店维修!7大车圈高管炮轰速成车乱象:消费者不能成试车员

快科技
2026-08-14 16:50:12
中国若强硬启动解放台湾地区的战争,美国大致有三种应对:一是直接参战;二是发动金融战,冻结中国海外资产;三是联合欧洲实施经济封锁

中国若强硬启动解放台湾地区的战争,美国大致有三种应对:一是直接参战;二是发动金融战,冻结中国海外资产;三是联合欧洲实施经济封锁

扶苏聊历史
2026-08-15 15:21:36
太阳报:格拉利什转会埃弗顿一事目前出现变数

太阳报:格拉利什转会埃弗顿一事目前出现变数

懂球帝
2026-08-15 17:00:08
比亚迪固态电池2027量产!刀片电池会沦为过渡产品吗

比亚迪固态电池2027量产!刀片电池会沦为过渡产品吗

周哥一影视
2026-08-15 10:54:27
每体:巴萨进账了5000万欧,却送走创造75粒进球的三人组

每体:巴萨进账了5000万欧,却送走创造75粒进球的三人组

懂球帝
2026-08-15 15:15:12
为什么推荐大家都去电影院看看《奥德赛》?

为什么推荐大家都去电影院看看《奥德赛》?

东方不败然多多
2026-08-15 03:31:12
马司令放过小三和前夫!少班主帮亲爹挡枪!

马司令放过小三和前夫!少班主帮亲爹挡枪!

八卦疯叔
2026-08-15 11:27:07
别再看俄乌了,普京要对中国“下手”?这一次,他选的时机太巧了

别再看俄乌了,普京要对中国“下手”?这一次,他选的时机太巧了

世界更加宽广
2026-08-14 08:23:03
官方发文,被立案调查仅72小时,郭德纲再传坏消息,这下麻烦大了

官方发文,被立案调查仅72小时,郭德纲再传坏消息,这下麻烦大了

小犙拍客在北漂
2026-08-15 19:04:47
奔驰官宣,国产全新GLE本月首发!

奔驰官宣,国产全新GLE本月首发!

汽车消费网
2026-08-13 22:33:53
4‑2 拿下津门虎,海牛若降级真对不起国安这位 “活雷锋”

4‑2 拿下津门虎,海牛若降级真对不起国安这位 “活雷锋”

姜大叔侃球
2026-08-15 22:08:56
1941 年日军一路追击国军溃兵,不料迎面撞上王牌74军,师长李天霞一个眼神警卫心领神会,一场血战令上高成为日军挥之不去的噩梦

1941 年日军一路追击国军溃兵,不料迎面撞上王牌74军,师长李天霞一个眼神警卫心领神会,一场血战令上高成为日军挥之不去的噩梦

唠叨说历史
2026-08-10 15:59:07
iPhone必须卸载8个隐藏预装程序!清理完电池续航直接暴涨

iPhone必须卸载8个隐藏预装程序!清理完电池续航直接暴涨

小柱解说游戏
2026-08-14 13:52:52
庄则栋落难朋友躲着走,郭兰英冲到太原摆三桌:他是我弟弟!

庄则栋落难朋友躲着走,郭兰英冲到太原摆三桌:他是我弟弟!

乡野小珥
2026-08-14 02:13:22
果然是惊世大才,美国总统今天突然宣布

果然是惊世大才,美国总统今天突然宣布

果妈聊娱乐
2026-08-15 09:13:34
经过两昼夜奋战,周口贾鲁河溃口成功合龙

经过两昼夜奋战,周口贾鲁河溃口成功合龙

极目新闻
2026-08-15 20:53:07
云泥之别!同样面对大勒布伦,张本智和4-0剃光头,一特质可怕!

云泥之别!同样面对大勒布伦,张本智和4-0剃光头,一特质可怕!

大秦壁虎白话体育
2026-08-15 21:57:39
山西一名民警因踩踏讨薪农妇致死被判五年,出狱后却频频喊冤,到底是怎么回事?

山西一名民警因踩踏讨薪农妇致死被判五年,出狱后却频频喊冤,到底是怎么回事?

人生录
2026-08-06 00:05:08
水均益飞福建给外孙女过周岁宴,举高高很开心,与前妻见面不尴尬

水均益飞福建给外孙女过周岁宴,举高高很开心,与前妻见面不尴尬

喜欢历史的阿繁
2026-08-15 13:34:14
正式官宣!超越17宇宙勇!太可怕了

正式官宣!超越17宇宙勇!太可怕了

贵圈真乱
2026-08-15 15:45:30
2026-08-16 00:07:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4435899文章数 9294关注度
往期回顾 全部

科技要闻

600亿美元收购落地 马斯克正式杀入

头条要闻

"榜一大哥"打赏女主播超千万要求陪睡 女方拒绝被起诉

头条要闻

"榜一大哥"打赏女主播超千万要求陪睡 女方拒绝被起诉

体育要闻

体系球员与体系本身

娱乐要闻

宋慧乔晒自拍照 微笑拍照心情佳

财经要闻

便利蜂加盟遭立案:"0元加盟"生意被查

汽车要闻

杨洋成001号车主 岚图追光S正式上市

态度原创

家居
艺术
手机
数码
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

25幅 中国当代画家的冬天油画

手机要闻

华为Mate XT2外观偷跑:U型三折叠+方形模组 一眼梦回Mate 20

数码要闻

极摩客EVO-X5迷你主机现身Geekbench:锐龙AI Max+ Pro 495处理器

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版