网易首页 > 网易号 > 正文 申请入驻

清华联合伯克利提出连续世界模型,机器人不用再逐帧猜环境

0
分享至



在具身智能的演进中,世界模型被寄予厚望:它不仅要生成未来画面,更要帮助机器人理解世界如何连续变化。然而,当前主流的视频生成与部分机器人世界模型,它们的底层架构大多仍受制于一个固有的思维定式:离散的下一步预测(Discrete Next-step Prediction)。

简单来说,这种模式将连续的物理世界切分成了一帧帧静态的画面。AI 预测未来时,必须像翻连环画一样,根据当前帧去推演下一帧。这种方式在短时间的视觉生成上大放异彩,但面对长视距的物理任务时,却暴露出明显缺陷:由于误差会逐帧累积,时间一长,AI 就容易偏离原本的物理规律,产生不合逻辑的幻觉。

近日,清华大学智能产业研究院(AIR)与加州大学伯克利分校(BAIR)团队合作提出了一种全新的预测范式 ODEWorld,其建立在连续的“物理时间流”(Physical-Time Flow, PT-Flow)之上。与传统方法直接预测下一帧是什么不同,ODEWorld 试图学习的是:世界究竟怎样从当前状态连续地变化到未来状态。


图 | 连续世界模型概念(来源:受访者提供)

实验中,当研究人员把模型预测出的连续中间状态用于指导机器人后,四项真机任务的平均成功率从 55% 提高到了 80%。

谈起这项研究的出发点,论文共同一作刘东岫告诉 DeepTech,“真实世界是连续变化的,机器人要理解世界怎样运动,其中速度是一个很重要的变量。看到一个物体运动,我们既要知道它往哪个方向走,也要知道它运动得有多快。传统的离散帧世界模型很难直接表达这些信息。”

世界模型,究竟是在“理解”还是“模拟”世界?

在讨论这项成果之前,我们需要先回答一个更基本的问题:今天被统称为“世界模型”的技术,究竟在做什么?

视频生成、三维世界建模、通过预测未来帮助机器人决策,以及让机器人进入虚拟环境训练,这些不同方向如今都可能被称为世界模型。但刘东岫认为,它们实际上可以进一步拆成两类目标:理解世界和模拟世界。

所谓“模拟”,是尽可能准确地复现真实环境。如果要让机器人进入一个虚拟世界进行大规模训练和测试,场景、物体以及各种视觉细节都需要足够逼真。在这条路线上,世界模型更像一个高仿真的模拟器。

“理解”解决的则是另一类问题。机器人看到一段人的操作视频,需要知道其中发生了什么;进入一个场景,需要识别物体在哪里、它们之间是什么关系,以及这些状态正在怎样变化,再把这些信息交给下游动作模型。

两者对模型提出的要求并不相同。模拟追求尽量还原现实,而理解并不要求保留每一个像素。相反,大量背景、纹理和视觉细节对于机器人当前的动作可能并不重要,模型需要把复杂视觉信息压缩下来,留下真正与状态和变化相关的部分。

“理解这件事情,本质上需要压缩。”他说,“我们希望找到一种更加自然、更接近本质的世界表征,再用这个表征指导机器人执行动作。”

按照这一划分,ODEWorld 更接近“理解”这条路线。对团队而言,问题不仅是把视觉信息压缩得更小,更重要的是:压缩之后,究竟应该保留什么。

他们认为,其中一个关键就是世界的动态变化。机器人不仅要知道场景里有什么、物体在哪里,还要理解物体正在怎样运动,以及这些状态如何随时间发生变化。

但现有视觉世界模型通常沿用视频本身的离散形式,根据当前帧预测下一帧。问题在于,视频虽然是一帧帧记录的,真实世界却始终连续变化。摄像头拍下的只是一个个时间切片,两帧之间,机械臂仍在移动,物体的位置、方向和速度也在不断变化。

因此,在刘东岫看来,仅仅压缩视觉信息还不够,模型还需要把这种连续变化本身表示出来。“传统的一些世界模型,是通过预测下一帧图片来理解世界。如果下一帧预测得很好,就认为机器人理解了世界怎么变化。但我们想做的是,不仅要知道下一帧是什么,还要让机器人理解它是怎么从这一帧变到下一帧的。”

除此之外,真实机器人采集到的视频也并不总是严格均匀。不同设备可能具有不同帧率,即便标称相同,传感器实际采样时间也可能出现误差或掉帧。离散模型往往弱化了这些真实的时间差异。

于是,ODEWorld 试图把“物理时间”重新带回世界模型:它关心的不再只是下一张画面是什么,而是此刻的世界正在朝什么方向、以怎样的速度变化?


图 | 生成效果(来源:受访者提供)

不再一帧帧猜,而是学习“世界往哪里走”

为了解决这一问题,研究团队提出了物理时间流(PT-Flow)。它不再直接学习这一帧之后是哪一帧,而是把世界的变化表示成一个随真实时间连续演化的过程。

第一步,是先把复杂的视觉信息压缩下来。

ODEWorld 使用预训练的 DINOv2 提取图像特征,再进一步把真正随时间变化的信息压缩到一个更小的空间中。原因在于,一张图片里包含大量背景、纹理等信息,但这些内容并不都与物体如何运动有关。

刘东岫认为,这种压缩对于面向机器人的世界模型尤其重要。“机器人最后要部署到真实世界,它不可能带着大量显卡支撑计算,因此必须高效压缩世界表征。”模型真正需要留下的,不是所有像素细节,而是有用的动态信息,也就是对世界变化本身的理解。

为此,团队设计了动态表征解耦,把相对稳定的背景和初始状态,与随时间不断变化的动态信息尽量分开,让模型集中表示什么发生了变化。同时,通过图像重建进行约束,保证压缩后的信息没有丢掉理解当前场景所必需的内容。

这种设计还试图解决隐空间世界模型中一个常见问题——表征坍塌(representation collapse)。

简单来说,如果压缩过头,不同画面、不同动作阶段可能最终都被模型表示成几乎一样的状态。刘东岫把这种情况形容为模型“摆烂了”:无论看到什么,都输出差不多的东西。这样虽然预测变得容易,但模型也失去了真正区分世界状态的能力。

ODEWorld 的做法,是把“保留状态信息”和“预测未来变化”拆开监督:一方面通过重建保证压缩后的表征仍然包含足够信息,另一方面专门学习这些状态如何随时间变化。论文的表征分析也显示,这种方式能够明显降低坍塌风险。

接下来是 PT-Flow 最关键的一步:学习世界变化的方向和速度。

虽然训练数据仍然是一帧帧图片,但相邻画面之间有真实的时间间隔。团队先从这些观测中估计变化速度,再通过 JVP(Jacobian-vector product,雅可比向量积)把图像层面的变化映射到压缩空间,得到更连续、平滑的动态变化,并让模型直接学习这种变化规律。

这样,ODEWorld 学到的就不再只是“A 之后是 B”,而是从 A 到 B 之间的状态怎样连续变化。

预测时,模型从当前状态出发,通过普通微分方程(ODE)求解器把每一刻的变化不断累积起来,因此可以得到未来任意时间点的状态。原本两帧之间没有被拍下来的时刻,也可以沿着这条连续轨迹推演出来。


图 | 任意时间分辨率生成(来源:受访者提供)

刘东岫举例说,如果数据集中前后两帧相隔 0.1 秒,ODEWorld 可以进一步预测 0.01 秒、0.05 秒等中间时刻的状态,并呈现连续的变化趋势。

同一套连续轨迹还可以反向求解。在不额外训练新模型的情况下,改变积分方向,ODEWorld 就可以从当前状态向过去反推。刘东岫将这一实验视为对模型连续性的一项验证:它不是简单把已有视频倒放,而是沿着模型学到的变化规律反向推演。


图 | 反向生成(来源:受访者提供)

这种在紧凑空间中预测的方式也带来了较高的计算效率。64 帧长程视频预测实验中,ODEWorld 在单张 A100 GPU 上的预测延迟为 0.072 秒,而 V-JEPA 2 和 LDP 分别为 0.619 秒和 3.953 秒。

预测速度提高的同时,画面质量也保持了较好的水平。在 64 帧长程预测中,ODEWorld 的 PSNR 达到 19.46(数值越高,说明预测画面与真实画面在像素上越接近),高于 V-JEPA 2 的 16.47 和 LDP 的 16.27;感知相似度指标 LPIPS 为 0.134(数值越低,说明看起来越自然、越接近真实),也优于另外两种方法。

因此,PT-Flow 改变的并不只是能否补出更多中间画面,而是世界模型描述变化的方式:传统方法主要学习“A 之后是什么”,ODEWorld 则进一步尝试学习“A 是怎样连续走到 B 的”。

从预测未来,到指导机器人行动

连续建模是否有价值,最终还要回到机器人任务本身:它能不能帮助机器人把动作做得更好?

为此,研究团队没有把 ODEWorld 生成的未来画面直接交给机器人,而是利用模型学到的连续轨迹,在当前状态和任务目标之间生成一系列中间状态,也就是隐空间子目标(latent subgoals)。

可以把它理解为给机器人增加了一组“中途路标”。例如完成插笔任务,机器人不能从“拿着笔”直接跳到“笔已经插进笔筒”,中间还要经历靠近笔筒、调整位置、对准开口、逐渐插入等多个阶段。ODEWorld 根据学到的世界变化规律预测这些中间状态,再把它们提供给下游动作模型,帮助机器人判断下一步应该朝哪里行动。

论文分别测试了速度信息、单个中间目标和连续多个中间目标三种指导方式。其中,连续提供多个子目标的效果最好。在 LIBERO-LONG 的 10 项长程操作任务中,这一方案平均成功率达到 83.6%。

研究团队随后将方法部署到真实双臂机器人上,测试夹虾入锅、鼠标收纳、插笔和双臂整理物体等 4 项任务。在底层 X-VLA 动作模型保持一致的情况下,加入 ODEWorld 提供的连续中间目标后,4 项任务的平均成功率从 55% 提高到 80%。

这组实验表明,ODEWorld 学到的连续变化信息不仅能够用于预测未来,也能够进一步转化为机器人执行任务时可以利用的指导信号。

刘东岫更期待的一个变化,是提高机器人学习新任务的数据效率。

机器人领域真正带有动作标注的数据仍然有限。如果世界模型能够先从更多图像和视频中学习世界如何变化,再把这种能力迁移给下游策略模型,就有机会减少每一个具体任务需要的机器人操作数据。

刘东岫表示,团队后续也希望继续推进 scaling,使这类世界模型逐渐成为更通用的上游模型,再通过较少的下游数据适配具体机器人任务,提高真实执行的准确率。

不过,ODEWorld 目前解决的仍然只是物理世界建模中的一部分问题。真实世界除了时间上的连续变化,还存在接触、碰撞、摩擦和力等更加复杂的物理规律。当前 ODEWorld 并没有对这些因素进行建模。

刘东岫也并不把连续时间视作世界模型的最终答案。“我们不会说它就是终局。”在他的判断中,未来更完整的方向应该是物理世界模型,而连续时间会是其中一个重要组成部分。

1.https://dstate.github.io/odeworld_website/

2.https://arxiv.org/abs/2607.27924

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
一周多达10次,48岁男子不幸猝死,妻子:多次劝说,他就是不听

一周多达10次,48岁男子不幸猝死,妻子:多次劝说,他就是不听

杜医生聊健康
2026-07-24 17:49:27
汤神:目前只想加入一支争冠球队,库里非常想打破我创造的三分纪录

汤神:目前只想加入一支争冠球队,库里非常想打破我创造的三分纪录

林子说事
2026-08-15 06:48:58
一手好牌打稀烂!歌坛天后跟“活佛”生下孩子,如今现状令人唏嘘

一手好牌打稀烂!歌坛天后跟“活佛”生下孩子,如今现状令人唏嘘

青杉依旧啊啊
2026-08-15 01:12:33
国内存款超过200万的家庭,究竟有多少?答案或吓你一跳?

国内存款超过200万的家庭,究竟有多少?答案或吓你一跳?

落梅如雪乱飞
2026-07-26 06:02:20
出狱后的雷政富沧桑感袭面而来,前后对比引人唏嘘

出狱后的雷政富沧桑感袭面而来,前后对比引人唏嘘

霹雳炮
2026-03-14 22:49:47
浙江为何被让2追3?王钰栋毫不客气说出原因,比主教练说的更直接

浙江为何被让2追3?王钰栋毫不客气说出原因,比主教练说的更直接

老汆古装影视解说
2026-08-15 22:35:49
47岁董璇高马尾亮相老公张维伊舞台剧,搂脖合照超恩爱

47岁董璇高马尾亮相老公张维伊舞台剧,搂脖合照超恩爱

阿废冷眼观察所
2026-08-15 10:29:02
实习生发了六张手术室照片,整个医疗圈炸了锅

实习生发了六张手术室照片,整个医疗圈炸了锅

网络易不易
2026-08-14 06:45:21
老板让归还10年前领用的电脑,有人直接提出:让老板拿出证据,证明拿走过电脑,否则告老板诬陷、敲诈!这话说得我相当震惊!

老板让归还10年前领用的电脑,有人直接提出:让老板拿出证据,证明拿走过电脑,否则告老板诬陷、敲诈!这话说得我相当震惊!

老田电脑
2026-08-15 11:54:38
正式确定退役!队史第一球星,配得上这个待遇!

正式确定退役!队史第一球星,配得上这个待遇!

德译洋洋
2026-08-15 11:38:49
笑不活!老辈子总能找到最贵的东西随手用 ,评论区炸锅了

笑不活!老辈子总能找到最贵的东西随手用 ,评论区炸锅了

石辰搞笑日常
2026-08-15 04:15:43
88岁吴伯雄上台致辞前不慎跌倒,称“会尽量活久一点”

88岁吴伯雄上台致辞前不慎跌倒,称“会尽量活久一点”

海峡导报社
2026-08-15 15:02:02
准世界一流飞人!陈妤颉起跑失误且故意压状态,真实实力在11秒内

准世界一流飞人!陈妤颉起跑失误且故意压状态,真实实力在11秒内

杨华评论
2026-08-13 22:31:16
同队天差地别!哈登年薪3630万,库明加600万薪资差距太扎心

同队天差地别!哈登年薪3630万,库明加600万薪资差距太扎心

林子说事
2026-08-15 13:35:44
祝贺哈登,1换1交易完成,骑士全力引进沃特森,要与76人一决雌雄

祝贺哈登,1换1交易完成,骑士全力引进沃特森,要与76人一决雌雄

小七说篮球
2026-08-15 16:39:20
拉唐传射 申花主场大胜河南!下一场新帅迎首秀!

拉唐传射 申花主场大胜河南!下一场新帅迎首秀!

五星体育
2026-08-15 22:06:39
闹大了!湖北省文旅厅介入,协调处置“郭德纲未报备改编红歌”事件,评论区热议

闹大了!湖北省文旅厅介入,协调处置“郭德纲未报备改编红歌”事件,评论区热议

陈意小可爱
2026-08-15 11:14:17
中方:这个人一贯攻击抹黑中国,曾亲自带武装部队抓扣中国公民

中方:这个人一贯攻击抹黑中国,曾亲自带武装部队抓扣中国公民

新浪财经
2026-08-15 00:45:13
当年抢破头,如今没人要?这7样“神物”的崩盘,你踩中了几个?

当年抢破头,如今没人要?这7样“神物”的崩盘,你踩中了几个?

阿莱美食汇
2026-08-09 09:25:55
48小时已过,国产C919准时着陆,首战大获全胜,美国对华断供失败

48小时已过,国产C919准时着陆,首战大获全胜,美国对华断供失败

林子说事
2026-08-15 04:07:51
2026-08-16 01:19:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17089文章数 515195关注度
往期回顾 全部

科技要闻

600亿美元收购落地 马斯克正式杀入

头条要闻

"榜一大哥"打赏女主播超千万要求陪睡 女方拒绝被起诉

头条要闻

"榜一大哥"打赏女主播超千万要求陪睡 女方拒绝被起诉

体育要闻

体系球员与体系本身

娱乐要闻

宋慧乔晒自拍照 微笑拍照心情佳

财经要闻

便利蜂加盟遭立案:"0元加盟"生意被查

汽车要闻

杨洋成001号车主 岚图追光S正式上市

态度原创

时尚
教育
房产
手机
公开课

12年才总结出这5个小习惯,真的让我的生活更轻松

教育要闻

重磅2026年软科世界大学学术排名!哪些中国内地大学进入全球百强?

房产要闻

金茂、招商,海南多个岗位招人!

手机要闻

网传小米澎湃HyperOS 4浏览器支持插件,用户可按需扩展浏览体验

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版