![]()
该项目的第一作者是南洋理工大学博士生、西湖大学访问学生陈奕文。指导老师是西湖大学通用人工智能实验室负责人张驰助理教授。
能生成一段逼真的画面,不等于能让一个世界持续运转。真正的开放世界不仅要回答「下一帧是什么」,还要记住屏幕之外发生过什么、规则如何作用,以及一次事件会怎样在很久以后继续改变角色与环境。
近年来,视频世界模型的画质、动作控制和交互速度快速提升,它们已经可以把键盘、鼠标、动作或文本指令转化为连续视觉画面。但现有系统的核心建模对象,往往仍是「接下来应该生成什么观察」。视觉历史能够记录看得见的结果,却很难直接保存世界规则、角色关系、事件历史和屏幕之外持续发展的因果链。
想象一下,游戏中如果玩家刺杀了一座城市的统治者并离开,城市秩序、继承关系、贸易、阵营联盟以及大量非玩家角色的信念和目标,都应该继续变化。等玩家很久以后返回,系统不仅要生成一幅「看起来合理」的城市画面,还要知道玩家离开期间发生了什么、为什么发生,以及这些后果接下来还会如何延伸。
为此,西湖大学 AGI Lab 的研究团队提出 Code World Model。它不再要求视频模型独自从视觉结果中反推所有隐藏机制,而是把「世界如何演化」和「世界如何被看见」拆成两个互补问题:Coding Agent 负责决定世界如何演化,代码负责让规则持续执行,视频模型负责把演化后的状态转化为高保真视觉观察。
![]()
图 1 Code World Model 概览:Coding Agent 维护规则与状态,Proxy 提供时空约束,视频模型负责高保真视觉实现。该图为论文中的 AI 生成示意图。
- 论文标题:Code World Model: Coding Agent as World Brain
- 作者:Yiwen Chen、Guosheng Lin、Chi Zhang
- 论文:arXiv:2608.25927
- 项目主页:https://buaacyw.github.io/cwm/
- GitHub:https://github.com/buaacyw/code-world-model
![]()
视频链接:https://mp.weixin.qq.com/s/A_HTUUeEbIrHhMbohN_zwQ
为什么只学习视频,还不够支撑开放世界
视频记录的是世界演化后的可见结果,却没有直接暴露产生结果的知识、规则和机制。游戏画面尤其如此:每一帧都由固定代码执行后渲染出来,但一旦变成训练视频,真正让世界运转的代码就被丢掉了,模型只能从稀疏的视觉后果中反推碰撞、攻击范围、阵营关系、任务状态等隐藏逻辑。
这种信息缺口在长时间尺度上更加明显。当前视频模型的上下文通常短于一分钟,而角色关系、社会结构和事件后果可能在世界时间里的几天甚至几年中持续演化。许多关键变化又发生在镜头之外。扩大视频训练规模可以增加「见过的结果」,却不会自动提供生成这些结果的白盒机制。
Code World Model 的判断是:开放世界需要两种不同的能力。一种是低频但复杂的推理 —— 理解事件、关联世界知识、规划后果、修改机制;另一种是高频而重复的执行 —— 更新位置、数值、日程、冷却、碰撞和规则。把两者全部塞给同一个视频模型,既低效,也难以保证结果可复现。
核心思路:
代码管「发生什么」
视频模型管「看起来怎样」
![]()
图 2 方法流程:交互意图进入 Coding Agent,Agent 通过代码更新 World State;世界状态经条件接口交给视频模型,生成视觉世界并形成反馈闭环。
在这一框架里,Coding Agent 是「世界大脑」。它读取当前世界状态,解释新的交互或事件,决定哪些实体和机制需要改变,并选择调用已有代码还是局部改写世界程序。代码则像 Agent 的可执行延伸,在不需要每一步都再次调用大模型的情况下,持续完成密集、确定、可复用的状态更新。
这意味着代码不是开发者预先写死、之后再也不变的游戏逻辑;它也不是一个与 Agent 分离的外部控制器。Agent 可以根据新情况组合、调用或修改代码,改变的不仅是「当前状态」,还包括这个世界今后如何运行。运行结果、测试和新的世界反馈再返回给 Agent,构成持续的 Agent–Code 闭环。
论文进一步把完整世界状态拆成两部分:可执行状态保存程序、实体属性、规则、关系与事件历史;视觉状态保存由视频模型生成、且需要在时间上保持一致的外观和运动信息。两部分由不同机制更新,但彼此耦合:代码确保规则与后果持续存在,视频模型则利用大规模视觉数据中学到的外观、运动与交互先验,把世界状态实现为高质量观察。
Proxy:
给世界状态增加一条可编程的「视觉通道」
确定了世界状态之后,新的问题随之出现:如何把不断变化的状态准确交给视频模型?只用结构化文本最简单,但文本很难以低延迟方式逐帧描述角色位置、遮挡关系、相机轨迹和实体运动;让 Coding Agent 直接建造完整 3D 世界虽然控制更强,却需要高质量资产、动画、材质、灯光与渲染系统,也会过早限定最终画面。
研究团队因此提出 Proxy:一种由世界状态确定性编译得到的粗粒度视觉条件。Proxy 不追求做出一个低配版成片,而只保留当前观察必须遵守的最小状态,例如实体位置、近似尺度、姿态、运动轨迹、空间关系、遮挡和相机运动。简单的人形、线框车辆、低多边形植被或包围盒,都可以成为可调用的基础组件。
结构化文本与 Proxy 分工明确:文本负责身份、外观、动作语义和风格,Proxy 负责逐帧的空间与时间约束。所有控制信号都能追溯到 Coding Agent 和代码维护的世界状态,因此这条「状态 — 条件」通路仍然是可检查、可寻址、可局部修改的白盒系统。
Proxy 的关键不是越精细越好,而是找到「可构建性」和「约束强度」的平衡。过于丰富的 Proxy 会要求 Coding Agent 同时维护大量关节与细节轨迹;过于稀疏又可能不足以约束视频模型。当前实现把 Proxy 的横纵分辨率都设为目标视频的四分之一,因此视觉 token 数量约为目标视频的十六分之一,额外推理负担相对有限。
数据怎么来:
把游戏运行时与真实视频编译到同一接口
![]()
图 3 游戏数据与真实世界数据中的 RGB–Proxy 对齐示例。相邻 RGB 与 Proxy 来自同一时刻,保留实体位置、场景布局、相机运动与遮挡关系。
要让视频模型读懂 Proxy,训练数据必须同时包含严格对齐的 Proxy 视频和 RGB 目标视频。游戏天然适合这项工作:研究团队在运行 GTA V 时同步记录画面,以及构建 Proxy 所需的相机、实体、场景和交互状态。代码可以从同一次运行记录中反复编译不同覆盖范围、不同信息粒度的 Proxy,而不必重新采集 RGB 视频。
这套接口也为真实视频留下了入口。论文在 KITTI-360 上进行了几何辅助的概念验证:校准相机位姿、语义 3D 重建和物体标注只用于离线编译 Proxy,视频模型最终接收的仍是 RGB 目标、Proxy 视频和结构化文本。对模型而言,相机运动和动作后果已经体现在 Proxy 中,不再需要额外定义独立的动作标签。
用约 5.6 小时游戏视频完成原型验证
当前原型在 MiniMax-H3 Ref2VA 视频模型上进行适配。训练数据来自 157 段游戏过程,总计约 5.6 小时;团队以两秒间隔采样出 9,420 个五秒训练片段。每个 RGB 目标包含 124 帧、分辨率为 1344×768、帧率为 24 FPS;与之对齐的 Proxy 为 336×192,并组合固定对数深度与语义 ID 图。
训练采用 rank-128 LoRA,覆盖 50 个 Transformer block,约 5.96 亿可训练参数,在 8 张 NVIDIA H800 上训练 3 个 epoch。推理时,研究团队使用 GPT-5.6 Sol 作为 Coding Agent;它基于已有的游戏引擎代码、基础玩家控制、碰撞和更新循环,组合、扩展并改写模板来构建目标世界。GPT Image 2 依据首帧 Proxy 和 Agent 编写的文本提示生成外观锚点,完整 Proxy 序列继续控制相机、实体运动和场景布局。
![]()
图 4 定性结果:每组上排为逐帧 Proxy,下排为视频模型生成的 RGB 观察。示例覆盖角色动作、飞行 / 镜头轨迹及多实体空间关系。
论文给出的定性结果显示,经过小规模 LoRA 适配后,视频模型可以在保持丰富外观与局部动态的同时,跟随 Proxy 指定的角色位置、动作轨迹、场景布局和相机运动。项目页还提供了与动作条件、相机条件视频世界模型的完整时序对比,用于展示 Proxy 在逐帧控制粒度上的差异。需要强调的是,这些比较主要考察控制效果,并未把推理延迟纳入比较。
从「按指令生成」到「在运行中改世界」
项目页最直观的一组演示,是 Coding Agent 对世界状态和操作机制的持续更新:角色可以在海底港口召唤飞行坐骑,在魔法学院执行舞蹈动作,在姜饼村落切换骑乘与移动,也可以在雪夜山村触发新的角色交互。画面的材质和风格由视频模型实现,但角色数量、近似位置、运动状态与关键空间关系仍由 Proxy 逐帧约束。
![]()
视频链接:https://mp.weixin.qq.com/s/A_HTUUeEbIrHhMbohN_zwQ
长时生成:
视觉风格可以切换,世界状态仍持续前进
为了生成更长序列,当前系统使用带重叠的 124 帧窗口:相邻窗口重叠 34 帧,每次向前推进 90 帧;前一窗口末尾的 RGB 帧负责局部连续性,同一个首帧外观锚点则帮助维持全局身份和外观。Proxy 条件贯穿完整时间轴,因此即使画面风格发生周期变化,实体轨迹、相机运动和关键空间关系仍有持续的状态来源。
![]()
图 5 长时生成视频 051 的 Proxy/RGB 对照截图。两分多钟序列中视觉风格发生切换,Proxy 持续提供实体与空间约束。截图直接提取自项目页视频素材。
![]()
视频链接:https://mp.weixin.qq.com/s/A_HTUUeEbIrHhMbohN_zwQ
这项工作真正改变了什么
Code World Model 的价值不只在于增加一种视频控制条件,而在于改变了世界模型内部的职责分工。传统视频世界模型倾向于把状态、规则、记忆、视觉预测都压进生成序列;这里则把可执行世界状态提到系统中心,由 Coding Agent 和代码负责因果演化,再把当前需要「看见」的部分选择性编译成条件。
这种分工让高层推理与低层执行解耦:Agent 不必以视频帧率工作,代码也不必具备开放式常识推理;视频模型无须从零学习完整规则,只需把明确的世界状态实现为视觉观察。即使未来语言与视频能力被统一进同一个多模态网络,外部代码维护的持续世界状态仍然需要一种高效、可控的输入接口,Proxy 所讨论的「状态 — 视觉条件」问题依旧存在。
在应用层面,这一范式指向的不只是游戏生成。一个能够保持规则、记住离屏变化并生成高保真观察的开放世界,也可能成为训练和评估智能体的环境,用于具身智能、自动驾驶和长期规划等需要理解、预测并作用于动态环境的任务。
结语:
世界模型的重点,或许不只是「下一帧」
如果说视频生成模型擅长想象「世界看起来是什么样」,Coding Agent 与代码则更适合回答「世界为什么会变成这样,以及接下来应该怎样继续变化」。Code World Model 试图把这两种能力放在同一个闭环里:让知识和规则驱动状态,让状态借助 Proxy 进入视觉空间,再让视频模型把结果实现为丰富、开放的观察。
这项工作仍处在早期,但它提出了一个值得关注的判断:通往开放式世界模型的道路,未必只是继续扩大视频预测模型,也可能需要把可执行代码重新带回世界演化的核心。世界不再只是连续生成的画面,而是一套能够被理解、修改、执行并持续留下后果的运行系统。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.