![]()
这项由香港中文大学、中国科学技术大学、华南理工大学、香港大学、南洋理工大学、北京大学、上海交通大学、卡内基梅隆大学、清华大学、华中科技大学、阿布扎比穆罕默德·本·扎耶德人工智能大学等多所顶尖机构联合完成的研究,于2026年7月以预印本形式发布,论文编号为arXiv:2607.27380,感兴趣的读者可以通过该编号查阅完整原文。
一、当AI视频遇上"物理考试":一个让人哭笑不得的问题
你有没有看过那种让人感觉"哪里不对劲"的AI生成视频?比如一块冰在热锅里神奇地没有融化,或者一个玻璃球摔在地上却像橡皮球一样弹起来。这些视频画面精美,色彩逼真,但就是感觉哪里出了问题——因为它们违反了我们从小就知道的物理常识。
这不是小问题。如果我们希望AI视频生成技术未来能用于电影制作、科学教育、工程模拟,甚至作为一种"理解世界运转方式"的工具,那么它就必须能正确展现物理规律。然而,当前主流的文字生成视频模型面临着一个根本性的困境:用户只需输入一句话,比如"一块黄油在热锅里慢慢融化",模型就需要凭空还原出这个过程的每一帧画面,包括黄油的软化、变形、起泡、焦化,以及最终流成一滩琥珀色液体的全过程。
问题是,这句话本身根本没有告诉模型这个过程是如何一步步发生的。模型必须从这几个词里"猜"出整个物理过程,同时还要把它渲染成漂亮的画面。这就像要求一个从没看过冰淇淋融化的人,仅凭"冰淇淋在太阳下融化"这七个字,就画出一段完整的融化过程——他可能会画出形状正确的冰淇淋,但流淌的方式、融化的速度、颜色的变化,很可能全都是瞎猜的。
研究团队把这个核心矛盾起了个专业名字,叫做"因果不透明性"——意思是用户的文字指令只说了"事情是什么",却完全没有说明"事情是怎么发生的"。正是这种不透明性,导致AI视频生成模型在物理一致性上频频翻车。
二、现有解决方案的局限:好看的地图,但没有导航
在这项研究之前,学界已经有人注意到了这个问题,并尝试了几条路子。第一种思路是在生成视频之前先做一个"计划"——让AI先写出文字描述、关键帧或布局草图,再把这些中间产物交给视频生成模型参考。这就像画地图一样,先确定几个关键地标,再让模型自己"连点成线"。但问题在于,地图上只有几个孤立的点,点与点之间的物理过程依然是模型凭感觉填充的,根本没有解决因果不透明的根本问题。
第二种思路叫做"测试时搜索"——简单说就是让模型生成一堆视频,然后挑最好的,或者不断修改直到满意。这更像是"广撒网,总有一条鱼"的策略,本质上是用运气弥补物理理解的不足,代价是巨大的计算资源消耗,而且依然无法保证物理正确性。
第三种思路更有意思,叫做"视觉状态推理"——让模型在生成视频的过程中,把中间的视觉状态也生成出来,形成一条"思维链"。但这条思维链是图像,不是物理过程的精确描述,而且往往只有几个稀疏的关键帧,中间依然存在大量物理推断的空白。
研究团队在这里打了一个非常形象的比方:这些方法给了模型"描述性"或"选择性"的帮助,却没有给它一个可以真正运行、验证、修改的过程级表示。换句话说,现有方法给的都是地图和路标,但没有给一个真正可以开着走的车。
三、VideoCoCo的破题之道:让代码替AI"打草稿"
研究团队提出的解决方案叫做VideoCoCo,这个名字来自"Code as Chain-of-Thought"的缩写,意思是"用代码作为思维链"。核心思想出人意料地简洁:既然文字说不清楚物理过程,那就用真正可以执行的程序来描述它。
具体来说,研究团队设计了一个"双引擎"系统,两个引擎各司其职,协同工作。
第一个引擎叫做"可执行仿真引擎"。当用户输入一段文字,比如"一块黄油在铸铁锅里慢慢融化,起泡,变成褐色",系统首先让一个"编程助手"(即代码智能体)把这段话翻译成一段Blender程序。Blender是一款专业的三维动画和仿真软件,它可以精确模拟物体的形状、材质、运动轨迹,甚至物理属性。这段程序会明确写出:锅的形状是什么、黄油的初始状态是什么、温度设置为多少、黄油会在哪个时间点开始软化、在哪个帧数开始流淌、最终扩散成什么形状。然后,这段程序在一个沙盒环境里被实际运行,渲染出一段低保真的"白模视频"——就像电影特效里的白色黏土模型,没有真实的材质和光影,但每一帧都精确对应着物理过程的一个实际状态。
这段白模视频就是所谓的"时空草稿"。它不漂亮,但它是真实的物理过程的精确记录——从初始状态到中间变化,再到最终结果,每一帧都有来源,每一帧都可以被验证和修改。研究团队特别强调,选择Blender Python代码作为推理的中间表示,有三个核心优势。代码是"显式"的,每个物体、每段运动、每个交互都必须被明确写出,不存在文字描述里的模糊地带。代码是"可执行"的,写出来的过程是真正可以运行的,而不仅仅是描述。代码是"可检查的",任何人都可以读代码、改代码、重新运行,整个推理过程完全透明,不是藏在模型内部的黑箱。
第二个引擎叫做"生成式视频引擎"。它的任务是接过第一个引擎渲染的时空草稿,把它变成一段真正漂亮、逼真的视频。这里还有一个关键的"指令助手":它会同时读取用户的原始文字和草稿视频,写出一段专门关注外观的编辑指令,描述黄油应该是什么颜色、锅的材质是什么感觉、光线应该怎么打、画面的焦距和构图是什么风格。这段指令刻意回避对运动过程的重新定义——因为运动已经由草稿决定了,指令只需要告诉视频编辑模型"把这个白模渲染成什么样子"就好。最终,视频编辑模型把草稿和外观指令合并起来,输出一段既物理正确又画面精美的高保真视频。
这个分工哲学背后有深刻的洞察:物理正确性和视觉真实性是两件本质不同的事,硬要让同一个模型同时做好两件事,往往两件事都做不好。把它们分开,让各自最擅长的工具来处理,反而能达到更好的效果。
四、解决"白模训练数据"难题:打造VideoCoCo-3K数据集
然而,把这套双引擎系统真正做通,还面临一个棘手的挑战:现有的视频编辑模型从没见过白模视频,它们所有的训练数据都是真实世界的视频。突然给它看一段灰扑扑的白模,它要么会无视其中的运动信息,要么会生成与物理过程相矛盾的画面。
为了解决这个问题,研究团队构建了一个全新的训练数据集,叫做VideoCoCo-3K。这个数据集包含3000组"草稿-指令-目标"三元组,每一组都包含一段白模草稿视频、对应的外观编辑指令,以及一段由高质量教师模型生成的光鲜目标视频——三者对应同一个物理过程。数据集的构建过程本身也是自动化的:系统对每个提示词运行整个双引擎流程,用白模草稿和指令生成目标视频,目标视频由当时最强的商业视频生成模型Seedance 2.0来完成,因为它能在保留运动结构的同时生成高质量画面。值得一提的是,数据集中的所有提示词都与评测基准保持了严格的隔离,以防止数据泄露,同时保留了原始提示词和Blender程序作为元数据,方便未来扩展和检验。
有了这个数据集,就可以对视频编辑模型进行针对性的训练,让它学会"看懂白模、保留运动、添加质感"这套技能。训练的目标函数是标准的条件去噪损失:让模型在给定白模草稿和外观指令的条件下,尽可能精准地还原出目标视频的画面。研究团队还对比了两种训练策略,一种是全参数微调,另一种是LoRA(低秩适应),即只调整模型中极少数参数的轻量化方法,最终发现LoRA的效果反而更好,原因是视频编辑模型本身的视觉生成能力已经足够强,不需要全面重训,只需要学会处理白模这个新任务就好。
五、测试结果:物理一致性的大幅跃升
研究团队在两个专门评估视频物理一致性的基准上进行了测试,分别是PhyGenBench和VBench-2.0。前者考察视频在力学、光学、热力学和材料动力学四个维度上的物理正确性,后者则专注于视频在力学、热力学和材料学维度上的物理合理性百分比。
在PhyGenBench上,添加了VideoCoCo之后,基础模型OmniWeaving的平均分从0.475提升到了0.558,成为所有参与对比的系统中表现最好的。这个分数超越了Pika、Gen-3、Kling等知名商业模型,也超越了CogVideoX、HunyuanVideo、Wan等大型开源模型。提升最明显的两个维度是材料动力学(提升0.133分)和热力学(提升0.078分)——恰恰是那些视觉先验最薄弱、模型最容易出错的类别,比如干冰升华、瓶子在真空中被压扁、鸡蛋摔碎、玩具在水上漂浮等。
在VBench-2.0上,结果更加亮眼。基础模型OmniWeaving的平均分原本只有52.18%,加入VideoCoCo后一跃升至77.88%,整整提升了25.70个百分点,成为所有参与对比系统中平均分最高的。在力学维度上,VideoCoCo的成绩达到了92.31%,在热力学维度上达到72.92%,均居所有系统之首。材料学维度上以68.42%排名第二,仅次于CogVideoX-1.5的83.19%。
研究团队还做了一组消融实验,专门验证"双引擎各自贡献了多少"。他们发现,即使完全不对视频编辑模型进行任何训练,只是把白模草稿直接送给原始OmniWeaving模型,平均分也从0.475提升到了0.506——这部分提升完全来自可执行草稿本身,与训练无关。在此基础上,再用LoRA训练适配视频编辑模型,最终分数进一步升至0.558。这个实验非常有说服力:代码草稿贡献了绝大部分的物理提升,而训练则在此基础上锦上添花。
定性的视频对比也印证了这一点。在干冰升华的示例中,OmniWeaving生成的视频画面里干冰保持着固体形态,根本没有升华;而VideoCoCo的版本则清晰呈现了干冰直接从固体变成气体、白雾弥漫的过程。在真空瓶压缩的示例中,OmniWeaving的视频里瓶子基本保持原状,但VideoCoCo的版本里瓶子真实地向内凹陷变形。在鸡蛋撞石头的示例中,VideoCoCo的版本展示了蛋壳碎裂、蛋液飞溅的完整冲击过程,而对比模型的结果则平淡如水。
六、这套思路的边界:目前还做不到什么
当然,这套方案并非万能。研究团队在论文中坦诚地指出了几个局限性。
首先,整个流程比直接文字生成视频多了代码生成和渲染两个步骤,推理延迟会明显增加。其次,系统的物理表达能力受限于Blender仿真器本身的能力范围——Blender擅长处理刚体运动、简单的形变和粒子效果,但对于高度复杂的流体湍流、细粒度的化学反应等现象,很难做出精确的程序化描述,这类场景的零样本生成效果就会打折扣。团队指出,未来可以考虑接入更专业的物理引擎(比如太极Taichi),以拓展可处理的物理现象范围。另外,从长远来看,一个更理想的方向是通过知识蒸馏,把这套可执行先验直接"内化"到端对端的视频模型里,从而省去推理时的仿真步骤,让模型自己就"懂物理"。
归根结底,VideoCoCo做的事情可以用一句话概括:在视频生成中引入了一个真正"可以开着走的车",而不只是漂亮的地图。代码是思维的载体,仿真是过程的证明,生成模型负责的是将这个已经被证明过的过程呈现得足够漂亮。这套分工方式,或许正是让AI视频生成走向真正"懂物理"的一条可行路径。
Q&A
Q1:VideoCoCo生成视频的过程具体是怎样的?
A:VideoCoCo分两个阶段工作。第一阶段,系统根据用户输入的文字,自动编写一段Blender程序并运行,生成一段低保真的白模动画视频,精确记录物理过程的每一帧。第二阶段,系统结合用户原始文字和白模视频,生成一段外观编辑指令,再由视频编辑模型将白模渲染成高保真的逼真视频,整个过程用户只需输入文字即可。
Q2:VideoCoCo和普通AI视频生成模型相比,物理效果提升了多少?
A:在PhyGenBench测试中,VideoCoCo将基础模型OmniWeaving的平均物理一致性分数从0.475提升到0.558,成为所有参与对比系统中最高分。在VBench-2.0测试中,平均物理合理性从52.18%大幅提升至77.88%,提升了约25.7个百分点,力学和热力学两个维度均排名所有系统第一。
Q3:VideoCoCo能处理所有类型的物理现象吗?
A:目前不能。VideoCoCo的物理仿真能力受限于Blender软件本身的范围,对刚体运动、简单形变、粒子效果等处理较好,但对复杂流体湍流、精细化学反应等现象目前难以精确建模,这类场景效果会有所下降。研究团队表示未来计划接入更专业的物理引擎来扩展处理能力。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.