![]()
你有没有想过一个很奇怪的事情:我们生活的世界明明是连续的,时间一分一秒流淌,物体的运动没有"帧"这个概念,但现在几乎所有的AI视频生成模型和机器人决策系统,都在偷偷把时间切成一段一段的碎片来处理。
这听起来像个技术细节,但其实是个挺大的问题。你去看那些生成视频的AI模型,不管是早期的扩散模型还是现在的各种"世界模型",它们的工作方式基本上都是这样的:把视频看成一堆图片帧的序列,然后一帧一帧地预测下一帧长什么样。机器人决策也是类似的逻辑,把连续的动作硬生生切成离散的时间步。
这就好比你想描述一条河流的运动,却只能给它拍快照,拍一张、两张、三张,然后试图从这些静止的画面里拼凑出"流动"这件事。你当然可以拍得足够密集来近似连续性,但代价是数据量爆炸,而且如果河流的流速突然变化,或者你想知道两张照片之间某个瞬间水流具体是什么样子,你就没办法了,因为你压根没建模那个瞬间。
这篇来自清华大学人工智能产业研究院(AIR)和加州大学伯克利分校BAIR实验室的论文,就是想彻底解决这个问题。他们提出了一套叫做**物理时间流(Physical-Time Flow,简称PT-Flow)**的新范式,并在此基础上构建了一个叫**ODEWorld**的连续时间世界模型。核心思路听起来很简单:别再把时间切碎了,直接用一个连续的数学方程去描述事物是怎么变化的。
当年的世界模型都卡在哪里
要理解这篇论文解决了什么问题,得先说说"世界模型"这个概念本身在干什么。
世界模型指的是一类AI系统,它试图学会预测"如果现在这样做,接下来会发生什么"。这在机器人控制和视频生成里都极其关键:机器人需要预知自己的动作会带来什么后果,视频生成模型需要知道画面接下来该怎么演变。
近几年,这个领域主要分成了两条路子。第一条是直接在像素空间里硬预测,把视频当成一堆图片,训练模型逐帧生成,代表性的方向包括Sora这类视频生成大模型。这类方法确实能生成很逼真的画面,但计算成本高得吓人,因为每一帧都是几十万甚至上百万像素点的高维数据,模型得花大量精力去拟合背景纹理、光影这些和"物理动态"其实没什么关系的细节。
第二条路是"潜在世界模型"(latent world model),试图先把图像压缩成一个低维的、更本质的表示,再在这个压缩空间里做预测,省去逐像素重建的开销。这条路里最有代表性的是**JEPA**
*JEPA:全称Joint Embedding Predictive Architecture(联合嵌入预测架构),核心思路是让编码器把图像映射到一个特征空间,再训练一个预测器在这个特征空间里预测未来*
这个系列的方法,包括V-JEPA、V-JEPA 2等等。它们的思路是同时训练一个编码器和一个预测器,编码器负责把图像变成特征,预测器负责在特征空间里预测下一步的特征该是什么样。
但JEPA系列一直有个挥之不去的老大难问题,叫**表征坍缩**
*表征坍缩(representation collapse):指模型为了让预测变得"简单",把所有输入都编码成几乎一样的特征向量,导致预测器"作弊式"地达到零误差,但这个特征空间其实什么有用信息都没编码*
说白了就是模型学会了偷懒。既然编码器和预测器是联合训练的,如果编码器把所有输入都压成同一个点,那预测器不管输入是什么都预测这个点,误差自然是零,训练损失完美收敛,但这个模型对世界一无所知。
这就像你让一个学生做数学题,如果他发现只要把所有题目的答案都写成"42"就能拿高分(因为出题老师批改不严),他大概率就不会真的去学怎么解题了。表征坍缩就是这种"钻空子"式的失败,模型在损失函数上表现完美,但学到的东西毫无意义。
为了防止这种偷懒,现有方法不得不加入各种正则化手段,比如V-JEPA 2用EMA(指数滑动平均)更新的目标编码器,或者其他工作引入额外的多样性约束。但这些补丁式的方案往往是拆东墙补西墙,为了防止坍缩而牺牲了模型本可以拥有的表达能力。
论文作者们观察到,所有这些方法,不管是像素级的视频生成还是潜在空间的JEPA系列,本质上都还是在离散时间框架里打转。它们没有真正把"时间"当成一个连续变量来对待,而这恰恰是物理世界最基本的属性。
PT-Flow:把动力学重新定义成一条速度场
那么PT-Flow到底想做什么?
它的核心想法是,与其把未来预测看成"猜下一帧长什么样",不如把它看成一个物理学里经典的问题:给定初始状态和一个描述系统如何变化的规律,求解未来任意时刻的状态。
这个规律,数学上就是一个**常微分方程**
*常微分方程(Ordinary Differential Equation,简称ODE):描述某个量随时间变化速率的方程,如果你知道某个时刻的状态和它的变化速率(即速度),理论上可以通过对速度做时间积分,推算出任意时刻的状态*
具体来说,论文设定一个压缩后的潜在表示 zt,代表某个时刻 t 的状态特征。这里的 t 不是第几帧这种离散计数,而是从初始状态算起、实实在在流逝的物理时间。模型学习的核心对象是一个速度场 vθ,它描述在潜在空间里,状态 zt 此刻正在以多快、朝哪个方向变化。
有了这个速度场,未来预测就变成了积分:从起点 z0 出发,沿着速度场一路"走"到时间 T,就得到了未来状态 zT。这个过程可以用现成的数值积分工具(比如经典的四阶龙格库塔法,RK4)来完成,就像求解物理里的运动方程一样。
这个思路和另一个近几年很火的生成模型技术**流匹配(Flow Matching)**
*流匹配:一种生成模型训练方法,通过学习一个从噪声分布到数据分布的连续变换路径(速度场),用ODE求解器生成样本,被用于Stable Diffusion 3等模型*
在数学形式上很像,都是学一个速度场,都用ODE求解器来生成。但论文特别强调了两者的本质区别:流匹配里的"时间"是一个人为构造的去噪进度,从纯噪声(t=0)走到真实数据(t=1),这个"时间"和现实世界的时钟毫无关系。而PT-Flow里的"时间"就是货真价实的物理时间,是视频里两帧之间真实流逝的那几百毫秒。这个区别决定了PT-Flow可以支持很多流匹配做不到的事情,比如任意时间点的插值、甚至时间倒流。
要让这套框架真正跑起来,还有两个关键设计。
**动力学表征解耦**
想解决的问题是这样的:视频里包含大量和"运动变化"毫不相关的信息,比如桌子的木纹、墙壁的颜色、灯光的角度。如果强迫一个ODE去拟合这些静态背景细节,就是在浪费模型的表达能力,而且这些静态内容根本不满足ODE该有的连续演化规律。
论文的做法是训练一对编码器和解码器,都以初始状态 s0 作为条件。编码器 fdyn(st; s0) 只负责从当前状态里提取"相对于初始状态发生了哪些变化"这部分信息,把这部分打包成一个干净的潜在表示 zt。解码器 gdyn(zt; s0) 则反过来,拿着这个变化信息加上原始的静态背景 s0,重建出完整的当前状态。
这就好比你要给朋友描述一部电影里主角走过一条街的过程。你完全不需要每一帧都重新描述街道两边的建筑、天空的颜色,这些从头到尾没变过。你只需要说"主角从路口走到了第三个门牌号",这句话本身就浓缩了变化的信息,而街道背景这种静态内容,你的朋友只要看第一帧就永远记住了,不需要在每一句描述里重复交代。如果不做这个解耦,模型就得在每次预测里同时处理背景细节和动作变化,相当于每次说话都要把整条街重新描述一遍,既低效又容易把注意力耗散在无关紧要的地方。
**直接一阶监督**
这是整篇论文里我觉得最巧妙的一处设计。
监督速度场的传统做法(也是JEPA系列的做法)是间接的:让预测器预测出未来的潜在特征,然后拿这个预测特征去和真实的未来特征做对比,算个误差。这种方式的问题在于,编码器和预测器是耦合在一起训练的,编码器完全可能为了让这个误差变小而作弊,把特征编码得极度简单,这就是表征坍缩的根源。
PT-Flow换了个思路。既然速度场描述的是潜在状态对时间的导数(也就是变化率),那能不能直接算出"真实的变化率应该是多少",然后让模型去拟合这个真实值,而不是去拟合"预测的未来状态"?
论文用了一个数学工具叫**雅可比向量积**
*雅可比向量积(Jacobian-Vector Product,简称JVP):一种计算函数对输入方向导数的技术,可以在不显式构造完整雅可比矩阵的情况下,高效计算函数输出关于输入某个方向的变化率*
来实现这一点。简单说,编码器 fdyn 把原始状态 st 映射成潜在表示 zt,这个映射关系是已知的、可微的。既然原始状态的变化速率 st(可以直接从相邻帧的差分里近似估算出来)是已知的,那么通过链式法则,就能推出潜在表示的变化速率 zt,这个推导过程正是JVP在做的事情。
这样一来,速度场的训练目标就不再是"猜一个可能被作弊的未来特征",而是"拟合一个由真实物理变化直接推导出来的速度值"。这个监督信号是硬邦邦的、无法被绕过的,编码器没办法通过把特征坍缩成一个常数来偷懒,因为一旦特征是常数,它的变化率就是零,而真实的变化率显然不是零,模型立刻就会在损失上暴露出来。
这就像考试从"写论文让老师主观打分"变成了"做数学题,答案唯一确定"。前者存在讨好评委、绕过真正学习的空间,后者答案是死的,你要么真的算对了,要么算错了,没有中间地带可以耍花招。
论文还提到了一个有意思的细节:即便去掉这个监督信号里常用的**停止梯度**
*停止梯度(stop-gradient)操作:训练技巧中一种阻止梯度流经某个分支的方法,常用于防止两个相互依赖的网络陷入互相"合谋"的退化解,是SimSiam等自监督学习方法里的经典设计*
技巧,PT-Flow依然能正常工作,这说明这套一阶监督机制本身就自带了防止退化的约束力,不需要额外补丁去防止模型偷懒。
ODEWorld的整体架构:把PT-Flow真正落地
有了PT-Flow这套理论框架,论文进一步把它实例化成一个完整可用的系统,也就是ODEWorld。
整个流水线的第一步,是用一个冻结的、预训练好的**DINOv2**
*DINOv2:Meta AI发布的一种自监督视觉特征提取模型,不需要人工标注数据就能学到高质量的图像特征表示,被广泛用作各种下游视觉任务的骨干网络*
编码器,把原始的高维图像观测压缩成一个特征空间。这一步的好处是数值稳定性更好,直接在原始像素上估计速度会因为像素噪声而抖动得很厉害。相应地,论文也训练了一个专门的解码器,把DINO特征重新映射回图像空间,用于最终生成视频画面。
在DINO特征空间之上,再叠加前面说的初始状态条件编码器和解码器(用交叉注意力实现),提炼出高度紧凑的动力学潜在表示 zt。论文一个挺让人意外的发现是,这个 zt 只需要一个token(也就是一个768维的向量)就足够了,相比之下原始DINO特征是16×16×768这么大的一个张量。这说明视频里真正和"动态"相关的信息量,远比原始像素信息量小得多,绝大部分像素其实都是冗余的静态内容。
速度场本身则用一个极其轻量的三层MLP来实现,用**FiLM层**
*FiLM(Feature-wise Linear Modulation):一种神经网络调制技术,通过一个额外的输入(这里是时间信息t)来动态调整网络中间层的缩放和偏移参数,从而让同一个网络能根据不同条件产生不同行为*
把时间信息注入网络。正因为这个速度场极其轻量,整个ODE积分过程的计算开销也就变得非常小,这也是ODEWorld后面能实现"实时"级别推理速度的关键原因。
为了进一步提升数值稳定性,论文还做了几个工程上的巧思。一个是把物理时间做了归一化处理,让训练用的时间尺度大致落在0到1之间,避免不同任务时长差异导致的数值问题。另一个更细致的设计是用**Savitzky-Golay滤波器**
*Savitzky-Golay滤波器:一种通过局部多项式拟合来平滑信号并估计导数的经典信号处理方法,相比简单的高斯模糊或者直接差分,它能在平滑噪声的同时更准确地保留信号本身的变化趋势*
来估计真实的速度目标 st,而不是简单粗暴地用相邻两帧相减除以时间间隔。这个细节看似不起眼,但论文的消融实验证明它对最终效果有实打实的影响,原始数据里天然存在的抖动和噪声,如果不做这层平滑处理,会直接污染整个训练信号的质量。
潜在空间到底学到了什么
理论说得再漂亮,也得看实际效果。论文里有一组可视化实验,我觉得特别能说明问题。
他们把ODEWorld学到的潜在空间和两个对照组做对比:一个是原始的DINO特征空间,另一个是一个"下一步预测"基线模型(一个典型的离散时间JEPA式模型)。通过PCA降维把轨迹画在二维平面上(如论文图2所示),结果非常直观:ODEWorld学出来的轨迹明显更加光滑,而DINO原始空间和离散预测基线的轨迹都充满了锯齿状的抖动。
这个平滑性不是白来的好处,而是那套一阶速度监督机制的直接结果,因为监督信号本身经过了Savitzky-Golay滤波处理,天然就带有平滑的性质,模型学出来的潜在流形也就继承了这种平滑。
但光平滑还不够,如果为了追求平滑把所有语义信息都抹掉了,那也没有意义。论文特别指出,ODEWorld的潜在空间虽然更平滑,但整体的拓扑结构和原始DINO空间保持了高度相似,主成分和几何结构都得到了保留。这意味着模型不是靠"过度正则化、把空间拉直"来偷懒式地实现平滑,而是真正学到了动态本身应有的连续性质,同时没有丢失原本的语义丰富度。
这就好比给一段抖动的手机录像做防抖处理。差的防抖算法会把画面处理得死板僵硬,仿佛所有细节都被磨平了;好的防抖算法则是在去除手抖噪声的同时,尽可能保留画面原本该有的层次感和细节。ODEWorld想要的正是后者。
紧接着,论文还可视化了速度场本身(图3),在PCA空间里画出一个网格,每个网格点上画一个箭头表示该处的瞬时速度。以一个"打开抽屉"的任务为例,可以清楚看到,当机器人手臂靠近把手时,速度场的箭头长度(代表速度大小)明显在变短,接近零;而当机器人开始真正拉动抽屉时,速度又重新增大。这说明模型不只是学到了"该往哪个方向走",还学到了"这个阶段动作该有多快"这种更精细的时序信息,这正是连续动力学建模比离散帧预测更有优势的地方。
双向预测和任意时间分辨率:连续性带来的额外馈赠
如果说前面讲的都是ODEWorld"补齐"了离散模型的短板,那接下来这部分才是真正体现连续建模独特价值的地方。
因为整个预测过程本质上是对一个常微分方程做积分,而ODE有一个数学上天然的性质:你可以正着积分,也可以反着积分。也就是说,只要把速度场的符号反过来(vτ 变成 –vτ),模型就能生成物理上合理的"倒放"视频。
论文的图4展示了这个能力,机器人抓取物体的动作,反向积分后能生成一个看起来完全符合物理规律的倒放版本,而不是简单粗暴地把正向生成的帧倒序排列。这个细节其实很重要,因为它验证了模型学到的确实是某种底层的连续物理规律,而不是死记硬背了训练集里见过的正向模式。
这就好比你录了一段扔球然后接住的视频,如果直接把视频倒放,你会看到球从手里"跳出去"、再"飞"到空中落下的诡异画面,这在物理上是不连贯的,因为原始的离散帧序列本身就没有编码任何"底层运动方程",倒放只是简单的顺序颠倒。但如果你真正理解了抛物运动的物理公式,你完全可以反向代入时间变量,算出一个物理上完全自洽的"倒放"轨迹,球会以合理的加速度和轨迹落回手中。ODEWorld做的正是后者:它学到的不是像素排列的顺序规律,而是背后那条连续的速度场方程。如果不这样设计,用离散的下一帧预测模型,你压根没办法定义"反向预测"这个操作,因为模型从头到尾都只学过"从帧A预测帧A+1"这一个方向。
除了双向预测,连续时间建模还带来了另一个实用能力,任意时间分辨率生成。图5展示了这一点:模型可以在任意想要的时间点(比如τ=0.03、0.06、0.09)生成对应的画面,而不受训练数据帧率的限制。更有意思的是,当训练数据本身被人为降采样(比如只保留原始帧率的三分之一)时,ODEWorld依然能够生成中间缺失的、时间上连贯的帧,也就是所谓的时间超分辨率能力。这对于处理现实中经常遇到的不规则采样数据(传感器掉帧、采集频率不一致等)非常有实用价值,而离散模型在这种场景下基本无能为力,因为它们的架构设计本身就假定了输入是等间隔的固定序列。
硬核数据对比:效果和速度双赢
说了这么多设计理念,最终还是得看真实的实验数字。
论文在LIBERO(一个包含130个任务、6500条人类远程操作演示的机器人仿真基准)和AgiBot-World(一个真实世界机器人操作数据集,约3万条轨迹)上做了大量测试。
在视频生成质量对比上,论文选取了两个有代表性的基线:**LDP**
*LDP(Latent Diffusion Planning):一种基于变分自编码器潜在空间做规划的方法,通过扩散模型在压缩后的VAE特征空间里生成未来轨迹,再用解码器还原成图像*
和前面提到的**V-JEPA 2**
*V-JEPA 2:Meta发布的视频版JEPA模型,联合训练一个表示编码器和一个潜在预测器,能够支持视频理解、预测和规划任务*
从下面的表格能看出结果的差距:
| 方法 | 短片段(16帧) PSNR↑ | 短片段 LPIPS↓ | 短片段延迟(秒)↓ | 长片段(64帧) PSNR↑ | 长片段 LPIPS↓ | 长片段延迟(秒)↓ |
| LDP | 16.33 | 0.489 | 1.104 | 16.27 | 0.461 | 3.953 |
| V-JEPA 2 | 17.60 | 0.157 | 0.123 | 16.47 | 0.166 | 0.619 |
| **ODEWorld** | **20.53** | **0.109** | **0.030** | **19.46** | **0.134** | **0.072** |
这里PSNR是像素级的还原质量指标(越高越好),LPIPS是更贴近人眼感知的画质差异指标(越低越好)。可以看到ODEWorld在两项质量指标上都是最好的,而且在长达64帧的长视野预测里依然能保持高质量,没有出现明显的画质衰减,这在离散帧预测模型里通常是个大难题,误差会随着预测步数累积滚雪球式地放大。
真正让人印象深刻的是延迟数据。对于64帧的长片段生成,LDP需要将近4秒,V-JEPA 2需要0.619秒,而ODEWorld只需要0.072秒,比LDP快了近55倍,比V-JEPA 2快了约8.6倍。这个速度优势直接来自前面提到的架构设计:动力学表征被压缩到极致紧凑的单token潜在空间,速度场又是个轻量的三层MLP,整个ODE积分过程的计算负担被压到了最低。
在机器人策略学习任务上,论文在LIBERO-LONG(一个专注长时序复合操作任务的子基准,包含10个需要多步骤连续完成的任务)上测试了三种不同的引导范式:用速度场直接引导、用单个子目标引导、用一串连续子目标引导。结果如下:
| 方法 | 平均成功率 |
| GLCBC(基础行为克隆) | 78.0% |
| SuSIE | 76.3% |
| Seer | 78.6% |
| VPP | 81.0% |
| ODEWorld(速度引导) | 82.3% |
| ODEWorld(单子目标) | 82.6% |
| **ODEWorld(连续子目标)** | **83.6%** |
三种ODEWorld变体全部超过了所有基线方法,其中连续子目标引导范式效果最好。论文的解释是,ODEWorld生成的轨迹在时间维度上足够精准连贯,能提供密集且不偏离任务目标的引导信号,这对下游策略学习是实打实的帮助。
更有说服力的是真实机器人实验。论文在一台双臂协作的AgileX机器人上,用**X-VLA**
*X-VLA:一种可扩展的跨本体视觉语言动作模型,通过软提示Transformer架构实现对不同机器人形态的统一策略学习*
作为策略骨干,测试了虾放入锅、鼠标打包、笔插入、双臂物品重排这四个任务,结果显示,加入ODEWorld生成的潜在子目标引导后,平均成功率从55%直接提升到了80%,提升幅度整整25个百分点。这个提升幅度放在真实机器人任务里是非常显著的,说明ODEWorld提炼出的动力学表示确实能给策略学习提供有效的、可迁移到真实世界的规划信息。
消融实验揭示的设计必要性
论文还做了一系列细致的消融实验,来验证每个设计选择是否真的必要,而不只是锦上添花。
去掉"动力学表征解耦"这个设计后会发生什么?论文的图7显示,学出来的潜在轨迹变得明显抖动和不规则,而定量表格显示,虽然PSNR略微升高了一点(20.65对比20.53),但LPIPS明显变差(0.127对比0.109),推理速度也慢了将近4.6倍(帧率从33.67掉到7.30)。论文对这个PSNR反常升高做了解释:PSNR这个指标本质上是基于均方误差的像素级对比,对大面积的静态背景特别敏感,如果模型不做解耦,反而会把大量精力花在忠实还原这些静态背景上,从而拉高PSNR,但这掩盖不了它在时序一致性和感知质量上的真实劣势。这提醒我们一件事:单一指标有时候会讲一个不完整的故事,得多个角度一起看才靠谱。
去掉"一阶速度监督",换成传统的多步一致性损失会怎样?结果更加戏剧化,短片段预测质量直接从PSNR 20.53暴跌到12.71,长片段甚至完全无法生成有意义的结果。论文分析认为,这是因为一致性损失把"重建"和"预测"这两个目标强行耦合在了一起,而且由于ODEWorld的目标本质上是"拟合某一个可行的ODE"而非"拟合唯一确定的物理方程",这个任务本身存在一定的欠定性,强行耦合的目标反而让优化陷入了困境。这个消融结果算是相当有说服力地证明了,直接一阶监督不是锦上添花的优化技巧,而是这套架构能跑通的关键前提。
另外几组消融也挺有意思:换成不同的视觉骨干网络(LIV、SigLIP 2),效果差距都不大,说明这套框架对特征提取器的选择有一定的鲁棒性;把潜在token数量从1个增加到4个,效果几乎没有提升,进一步印证了单token已经足够承载动态信息这个判断;针对语言指令这种更常见的目标条件形式,论文训练了一个轻量的目标图像预测器来把语言转换成视觉目标,测试显示用预测出的目标图像和用真实目标图像的效果几乎一致,说明这套框架完全可以自然地扩展到语言指导的场景,不需要依赖昂贵的目标图像输入。
论文还专门用**RankMe**
*RankMe:一种通过计算特征表示矩阵的有效秩来衡量自监督表示质量的方法,有效秩越高,说明特征空间的维度利用越充分,越不容易发生表征坍缩*
这个指标去量化验证了表征坍缩问题确实被规避了。数据显示,ODEWorld的768维潜在表示在不同规划时长下有效秩都维持在400以上,明显高于V-JEPA 2(203.7)和DINOv2原始特征(376.1)。这算是给"PT-Flow天然规避表征坍缩"这个说法找到了一个可以量化的证据。
局限性:论文没有回避的地方
值得一提的是,论文自己也坦诚列出了几个尚未解决的局限。
首先是训练规模的问题,相比动辄用数百万甚至更大规模视频数据训练的大型视频生成模型,ODEWorld目前只在两个机器人数据集上训练,规模确实偏小,这主要是算力资源的限制,作者也表示未来可以考虑扩大模型和数据规模。
其次,DINOv2这个骨干网络本身是为单帧图像设计的,没有专门考虑时序一致性,这可能导致提取的特征本身带有一定噪声。论文用Savitzky-Golay滤波器做了一定程度的补救,但这终究是个"打补丁"式的方案,未来如果换成天然带时序一致性设计的编码器,或者在训练过程中联合微调DINO本身,效果可能会更好。
最后,当前版本的ODEWorld主要聚焦在视频生成层面,还没有把动作条件直接整合进这套框架里。这意味着它目前更多是作为一个"世界理解和规划引擎",为下游策略学习提供子目标引导,而不是一个端到端直接输出动作的完整系统。论文提到未来可以考虑把动作条件注入到预训练好的ODEWorld中,进一步释放它在控制任务上的潜力。
写在后面
读完这篇论文,最让我意外的一点其实是那个"单个token就够了"的发现。
我们总觉得要描述一段视频里的动态变化,应该需要很多信息才够,毕竟画面里有那么多物体、那么多细节在同时变化。但ODEWorld的实验结果说明,真正承载"运动本质"的信息量,可能远比我们直觉认为的要小得多。一个768维的向量,就足以概括机器人手臂从A点移动到B点这整个过程里所有值得关注的动态信息。
这让我想起一个不完全对应但精神上相通的类比:物理学里描述一个物体的运动,其实只需要几个变量,位置、速度、加速度,你不需要记录它经过的每一粒尘埃、每一道反光。ODEWorld某种程度上是在用深度学习的方式,重新发现了这个"少即是多"的规律,而且是在没有任何显式物理先验的情况下,纯靠数据驱动学出来的。
还有一点值得琢磨的是,论文里那个反向预测的实验其实提出了一个挺深的问题:如果一个模型真的理解了某个过程的动力学规律,它应该天然具备"倒着推演"的能力,就像你如果真懂牛顿力学,给你末态你也能算出初态。这某种程度上可以当作检验一个AI系统是不是真的"理解"了某个物理过程,还是只是在记忆训练数据里见过的模式的一个判据。这个思路会不会能推广到其他领域,比如让语言模型也具备某种"可逆推理"的能力,检验它是不是真懂了某个逻辑链条,还是只是背下了一个固定的答案模式?这个问题我目前没有答案,但觉得值得继续想下去。
Q&A
Q1:ODEWorld是什么,它和普通的视频生成AI有什么不同?
A:ODEWorld是清华AIR和UC伯克利BAIR联合提出的一种连续时间世界模型,核心区别在于它不把时间切成一帧一帧的离散片段,而是学习一个连续的潜在速度场,用常微分方程描述状态如何随物理时间演变,未来预测因此变成了数学上的积分运算,而不是逐帧猜测。
Q2:PT-Flow是怎么解决表征坍缩这个老问题的?
A:PT-Flow采用直接一阶监督策略,通过雅可比向量积把真实状态的变化速率直接投影到潜在空间,得到一个硬性的、无法被绕过的速度监督信号,编码器没办法靠把特征坍缩成常数来偷懒,因为常数的变化率永远是零,这和真实的动态变化速率对不上,从而从根本上规避了传统JEPA架构容易出现的表征坍缩问题。
Q3:ODEWorld在实际机器人任务上表现怎么样?
A:在LIBERO-LONG长时序任务基准上,ODEWorld引导的策略平均成功率达到83.6%,超过了多个主流基线方法;在真实世界的双臂机器人实验中,加入ODEWorld生成的潜在子目标引导后,四个操作任务的平均成功率从55%提升到了80%,同时它的推理延迟也远低于对比模型,长视频生成速度比部分基线快了50多倍。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.