智猩猩AI整理
GIM-World 团队投稿
视频世界模型(video world model)正在成为交互式生成的新范式:给定过去的观测和一串动作或相机运动,模型直接"演"出接下来的画面。Genie、Oasis、Matrix-Game 等工作已经展示了这一方向的潜力。
但当 rollout 从几秒拉长到几分钟,单帧画质不再是瓶颈,长程一致性才是核心难题:走过的房间回头再看应该还是同一个房间,来回走一趟场景布局不能变,新生成的视角必须和之前建立的结构兼容。而这一切取决于一个问题——当观测滑出模型的上下文窗口之后,模型到底"记住"了什么。
现有的记忆机制大致分两派。显式记忆把历史观测原样存下来,要么在每一步检索历史帧喂给生成器,要么在线维护一个 3D 重建。前者依赖视觉相似度、相机重叠等启发式规则,检错一帧就可能让不一致沿着 rollout 传播下去,保留帧之间的外观冗余也限制了有限记忆里能装下的场景信息;后者需要在生成器旁边再跑一条重建流水线,增加推理延迟和工程复杂度,对动态物体、遮挡、弱纹理也比较敏感,重建误差还会随 rollout 累积。隐式记忆则用一个与生成器解耦的记忆模型,把历史压缩成紧凑的世界状态,但现有设计缺少几何层面的训练信号:压缩的是跨视角高度冗余的外观信息,压出来的状态并没有被要求编码跨视角的场景结构。
针对这一问题,快手可灵研究团队联合南京大学、清华大学提出了面向视频世界模型的几何感知隐式记忆框架GIM-World。核心想法很简单:几何应当是"被记住的世界"本身的属性,而不只是加在生成器上的一个额外信号,因此它应该被编码进记忆状态里。GIM-World 用一个轻量的 Transformer 编码器把任意长度的历史压成固定数量的记忆 token,在训练时通过一个可按相机查询的几何头,把冻结的 3D 基础模型(VGGT)中的场景结构蒸馏进记忆,并用信息引导的剪枝规则保证编码代价随历史增长而有界。推理时几何头和 3D 教师模型全部丢弃,只剩一个开销不到扩散主干 0.3% 的记忆模块。
![]()
图1 GIM-World 示意。同一条相机轨迹下,基线在重访时出现几何失真与记忆不一致,GIM-World 保持场景结构与外观一致。
在 MIND 基准上,GIM-World 在记忆一致性、相机动作精度和 3D 几何一致性三组指标上全面超过显式与隐式记忆基线,其中归一化重投影分数在第一人称和第三人称设定下分别达到 81.70 和 87.10,对应最强基线为 73.97 和 70.82;单场景 rollout 推到一千帧,相隔六百多帧重访同一视角时物体位置和纹理依然对得上。该论文已被 SIGGRAPH Asia 2026(Conference Track)接收。
![]()
论文标题:Geometry-Aware Implicit Memory for Video World Models
01
方法
视频世界模型在第 t 步根据历史观测(帧或其 VAE 隐变量,以及对应相机位姿)和未来动作,采样接下来的 K 帧,再把新帧连同相机追加进历史,循环往复。
直接以无限增长的历史观测信息为条件无法随 rollout 长度扩展,因此基于记忆的世界模型用一个记忆算子 M 把历史总结成状态,再以状态为条件生成。M 的形式就是整个设计空间:检索帧、缓存 token、显式 3D 重建,或者学一个隐式状态。GIM-World 选择最后一种,并从三个部分来约束这个状态。
![]()
图 2 GIM-World 框架概述。上:历史隐变量先经信息引导剪枝,再压缩为少量记忆 token,与动作嵌入一起条件化 DiT 生成下一段隐变量;左下:记忆编码器用两层紧凑自注意力 + 前馈层融合历史隐变量、相机嵌入与记忆 token;右下:训练时随机采样一帧历史,用其相机生成 ray map 查询记忆,解码结果与该帧的 VGGT 特征做几何损失。
1. 隐式记忆编码器
记忆编码器把带相机索引的变长历史映射到固定数量的记忆槽。历史帧先经视频 VAE 和扩散主干的 patch embedding 变成 patch token。由于同一个场景点会出现在多个视角里,团队只在历史 token 上加入相机嵌入,而记忆 query 本身保持与位姿无关,因此不与任何特定视角或未来动作绑定。
编码器维护 N 个可学习的记忆 query,与带相机信息的历史 token 拼接后送入仅两层的 Transformer 块。每一层由一个紧凑自注意力分支和一个全分辨率前馈分支组成:Compact 算子用共享线性层把每 s×s 个 token 折叠为一个,注意力在缩小 s² 倍的 token 上进行,再由 Expand 算子还原,前馈层则始终在全分辨率上工作。
![]()
两层之后取前 N 个 token 作为记忆 m,沿时间轴与目标隐变量拼接送入扩散主干(沿用 Context-as-Memory 的注入方式)。记忆大小不随历史增长,编码器在推理时的开销相对扩散主干几乎可以忽略。
2. 相机可查询的几何监督
流匹配损失只要求生成器预测未来帧,并不规定记忆应该存什么。一个固定大小的隐式记忆很可能把容量花在冗余的外观投影上——对短期重建有用,却不是一个好的紧凑世界状态。GIM-World 因此在训练时加入一个直接约束记忆的几何监督信号。
这里有一个关键的设计选择。Geometry Forcing 一类方法把 3D 基础模型(如 VGGT)的逐帧特征与生成器中间层特征做 token 对 token 的对齐,这要求学生表示仍按帧和空间位置索引。而 GIM-World 的记忆经过压缩后,token 与输入帧或 patch 之间没有一一对应,强行逐 token 匹配会给记忆槽施加人为的顺序,把表示重新推回按帧索引的缓存。团队的做法是通过历史相机去查询记忆,再把查询结果与 VGGT 特征对齐。
3. 信息引导的历史剪枝
记忆虽是固定大小,但形成记忆的代价仍随历史 token 数增长。长 rollout 里大量视角是冗余的:相邻相机往往只是以略微不同的投影观察几乎相同的内容。GIM-World 在编码前对历史做剪枝:在预算 K 内保留一个子集 S,使其对被丢弃的帧尽可能有信息量,即最大化互信息:
![]()
这正是 Krause 等人在传感器布置问题中提出的经典准则。为了计算互信息,团队在逐帧观测上放一个高斯过程,核函数由相机位置、相机朝向和时间三项 RBF 组成:两帧的相机在空间上接近、朝向相似、时间相近,就被视为高度相关。三个带宽不需要手调,位置和朝向带宽取中位数启发式,时间带宽取候选池时间跨度除以 K。
互信息目标是次模函数,标准贪心算法可以得到近似最优解;每一步的边际增益是两个后验方差的对数比——分子衡量"已保留集合预测不了这一帧",分母衡量"其余未选帧能很好预测这一帧",因此贪心会选出既能带来新信息、又具有代表性而非离群点的帧。默认预算下,贪心选择在 CPU 上每个生成块约 0.2 秒。
4. 训练与推理
扩散主干以记忆和未来动作序列为条件,用流匹配目标训练;记忆编码器、几何头和主干在
![]()
联合优化,单阶段端到端,没有单独的预训练、蒸馏或微调步骤。推理时几何头和 VGGT 编码器全部丢弃。
实现上,主干采用 Wan2.1,动作嵌入加到时间步嵌入上(沿用 MIND-World),记忆大小设为 20 个隐帧的 patch token 数,紧凑步长 s = 2,剪枝预算 K = 200,λ = 0.05。
02
评估
实验训练和评测均在 MIND 基准上进行。基线沿显式/隐式记忆两条线选取:显式记忆包括 Matrix-Game 2.0、MIND-World(数字直接取自基准)以及在相同设定下重新训练的 FramePack 和 Context-as-Memory;隐式记忆复现了 VideoSSM 的 SSM 记忆模块。四个重训基线与 GIM-World 使用相同的 Wan2.1 主干、相同的记忆 token 预算、相同的训练数据和日程,比较的只是记忆设计本身。
评测指标分三组:(1)记忆一致性,按 MIND 的长上下文协议逐帧计算 rollout 与真值视频之间的 MSE、PSNR、SSIM、LPIPS;(2)相机运动精度,用 ViPE 从生成视频中估计相机轨迹,与真值轨迹做 Sim(3) 对齐后,计算平移和旋转的相对位姿误差(RPE);(3)几何一致性,用 Depth Anything 3 估计逐帧深度和位姿,计算跨帧循环重投影误差并归一化为 0–100 的分数,越高越好。
1. 定量对比
表 1 给出了第一人称和第三人称子集上的结果。GIM-World 在两种视角下都取得了最好的记忆一致性,四项重建指标全面优于显式和隐式记忆基线。差距在 3D 几何一致性上最为明显:归一化重投影分数第一人称 81.70、第三人称 87.10,而拥有可比指标的最强基线分别只有 73.97 和 70.82。
这一结果也印证了方法的出发点。显式记忆虽然把历史观测保留给生成器,但保留帧或打包 token 本身并不能形成紧凑的跨视角世界状态,重投影分数明显偏低;SSM 基线提供了紧凑的隐式状态,但缺少几何监督,在重投影和记忆一致性上都更差。GIM-World 保留了隐式记忆固定大小的优点,同时监督这个状态去编码视角一致的几何。动作精度方面,GIM-World 在每个子集上都不低于最强基线(第三人称的平移和旋转 RPE 分别为 0.0106 和 0.1588,为全表最优),说明改善记忆的几何结构并没有以牺牲可控性为代价。
表 1a MIND 第一人称测试集上的定量对比(节选主要列)
![]()
表 1b MIND 第三人称测试集上的定量对比(节选主要列)
![]()
2. 定性对比
图 3 和图 4 在第一人称和第三人称场景上比较了 GIM-World 与 FramePack、Context-as-Memory、SSM。基线出现明显的结构崩塌:场景布局在前一百帧内就开始漂移,墙面和地标结构变形或消失,生成内容很快就不再对应输入所在的环境;第三人称设定还暴露了角色行为问题——基线要么丢失可控角色,要么把角色画在不一致的位置。GIM-World 只在个别帧上有小的视角偏移,整体场景几何、布局、地标和角色姿态在整个时域内都与真值保持一致。
![]()
图 3 第一人称 MIND 场景上的定性对比。
![]()
图 4 第三人称 MIND 场景上的定性对比。
图 5 进一步把单场景 rollout 推到一千帧,每 50 步采样一帧。黄框标出的第 100 帧和第 750 帧是相机相隔六百多帧后重访的两个相近视角,其中绿框和红框里的小物体在如此长的间隔后仍保持相同的空间位置、相对排布和纹理细节。这说明隐式记忆存下的是一个稳定的场景 3D 表示,而不只是在传播短期上下文。
![]()
![]()
图 5 千帧长程 rollout(第 50 帧至第 1000 帧)。
3. 记忆里到底存了什么:直接探针
团队在未见过的评测场景上直接检验压缩后的记忆是否编码了可查询的几何状态:编码一段场景历史,用训练时的几何头在目标相机处查询,再与目标帧的 VGGT 特征比较余弦相似度(表 2)。把目标帧从编码器输入中扣掉,相似度几乎不变(0.9390 → 0.9388);而查询一个远处相机,或换成另一个场景的记忆,相似度骤降到 0.4239 和 0.2712。也就是说,几何头是从周围观测中恢复出特定视角的表示,而不是在检索某个按帧索引的缓存,也不是靠自身先验。图 6 用共享 PCA 基把原始和重建的 VGGT 特征投影成 RGB,重建特征保留了原始特征的主要空间结构,仅损失部分高频细节。
表 2 记忆几何的直接探针
![]()
![]()
图 6 四个查询视角下的 VGGT 特征重建。
4. 开销
所有重训的记忆基线共享相同的记忆 token 预算,DiT 一侧的上下文开销一致。表 3 显示 GIM-World 每个 rollout 步的总计算量仅比 Context-as-Memory 高 0.29%,恰好等于记忆编码器本身的开销。与在线重建路线相比(Spatia 使用不同的生成器,因此只比较记忆维护部分),随着历史从 50 增长到 400 个隐帧,GIM-World 编码器的开销为 21 / 46 / 126 / 126 TFLOPs——剪枝在 200 帧之后把开销封顶——而 Spatia 的重建开销为 94 / 253 / 775 / 2,599 TFLOPs,记忆维护便宜 4.5 到 20 倍。
表 3 单步 rollout 的端到端计算量
![]()
5. 真实视频
团队还在一个真实室内场景上测试了 GIM-World。如图 7 所示,生成的 rollout 在 800 帧内保持了房间布局、主要结构元素和整体外观的一致,表明几何感知记忆的能力可以从合成环境泛化到真实场景。
![]()
图 7 真实场景上的 GIM-World rollout,每 100 帧采样一帧。
6. 局限
GIM-World 从 VGGT 蒸馏几何,而 VGGT 主要是静态场景先验,高动态内容可能表征不足;教师是模块化的,可随成熟的动态 / 4D 几何模型替换。目前的基准缺少足够长且带重访轨迹的真实世界 rollout,真实场景的定量评测和更大环境留待后续工作。此外位姿-时间接近度在遮挡边界附近、或相机不动而外观变化时可能误判内容重叠,固定的剪枝预算能约束但不能消除这类误差的影响。
03
总结
GIM-World 把"几何"从生成器的附加信号变成记忆本身的属性:固定大小的隐式记忆、训练时才存在的相机可查询几何头、以及有界开销的信息引导剪枝,三者组合让视频世界模型在千帧级别的 rollout 中保持几何与视觉的一致,同时推理开销几乎不增加。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.