一个穿特定服装的人走进实验室,离开画面,再次返回时——AI可能已经给他换了脸、换了衣服,甚至把原本该出现的物体也“忘”了。这是长视频生成里最隐蔽的翻车现场:模型能连续生成一分钟画面,却记不住主角长什么样。
问题出在记忆机制上。自回归视频模型通常分段生成画面,用Key-Value(KV)缓存保存上下文。为了控制计算量,缓存往往优先保留最近片段,短期动作能连上,但更早的身份、属性和场景线索就被挤了出去。
![]()
浙江大学与香港大学团队提出的LayerRecall,没有选择把整段历史一股脑塞回模型,而是同时回答两个问题:现在该想起什么?这段记忆该在哪些层里使用?
记忆不是越多越好
很多人第一反应是:既然模型会忘,那就扩大缓存,或者让每一层都读取远期历史。但视频DiT内部并不是整齐划一的“同一种大脑”。团队对LongLive-2.0逐层分析后发现,有些层更依赖当前与近期画面,负责维持姿态、运动和局部连续性;另一些层才会对远期历史投入更多注意力。
类似的层间差异也出现在论文测试的LongLive和Self-Forcing骨干中,但峰值位置并不完全相同。这意味着“哪一层需要长时记忆”与具体骨干有关,不能把同一组层位置当成所有视频模型的通用答案。
更关键的是,如果把历史K/V注入所有层,远期线索可能反过来打乱当前运动。论文的All-Layer Routing对照正说明了这一点:模型有了更多历史,却更容易出现突变和时间抖动。
两把钥匙:找对记忆,用对层
LayerRecall把长视频记忆拆成两条路线。第一把钥匙是What to Retrieve,决定现在该想起什么。系统为历史chunk建立紧凑摘要,当前画面到来后,路由器读取当前隐藏状态,形成随生成内容变化的查询,再从历史候选中找出最相关的记录。
这里有个技术细节很重要:摘要只负责检索打分,真正送入注意力计算的仍是被选中chunk的完整K/V。换句话说,它用小索引找资料,却不会只把“内容摘要”交给生成模型。
第二把钥匙是Where to Use,决定记忆送进哪些层。被选中的记忆敏感层可以同时看到sink、检索历史和当前chunk;其他层继续使用原来的局部滑动窗口。这样一来,负责远期身份和属性的层能拿到旧线索,负责当前动作的层则不会被迫反复“回忆过去”。
这也澄清了一个容易产生的误解:LayerRecall并不是每一步都动态选择网络层。当前状态动态控制的是“取什么”,“在哪里用”则来自针对具体骨干的层策略。
谁来教路由器学会“回忆”?
训练记忆路由器还有一个难题:现实中没有人逐帧标注“此刻应该找回第几个历史chunk”。高质量长视频训练样本本来就稀缺,显式记忆分配标签更不存在。
为此,论文提出Cross-Horizon Prediction Matching(CHPM)。它使用同一个冻结视频骨干构造一位“看得更远的老师”和一位“记忆受限的学生”。teacher最多可见384个latent frames的长历史;student单次注意力可见预算只有32帧,只能依靠局部上下文和LayerRecall补回关键信息。
CHPM不要求student复制teacher的注意力图,也不需要知道teacher究竟用了哪一段历史。它只比较两者面对相同噪声、文本条件和扩散时间步时的去噪预测,让路由器自己找到能缩小预测差距的记忆选择。
同样使用十个记忆层时,随机初始化路由器的MemoBench Overall为0.519,经过CHPM训练后达到0.548。整套训练只优化约165万参数的视频记忆路由模块,5B生成骨干、文本编码器和VAE均被冻结。
结果:长程召回提升,基础质量没被换掉
论文设计了100个未参与训练的三镜头prompt,专门测试主体、颜色、位置和场景四类长时记忆压力,每类25个案例,并与13个长视频生成或记忆增强基线进行比较。
在这套评测协议和所比较方法中,LayerRecall的MemoBench Overall达到0.548,高于最佳基线MemFlow的0.531;MovieBench Overall达到0.578,高于最佳基线Rolling Forcing的0.548。
与此同时,LayerRecall的VBench-Long平均分为0.978,与LongLive-2.0骨干持平。它不是VBench-Long全表第一,但至少在论文报告的设置里,长程召回能力的提升没有以降低自身骨干的这项平均表现为代价。
额外路由也不是“零成本”。匹配H100设置下,端到端生成时间从305.9秒增加到309.4秒,增量约3.5秒;解码帧吞吐从5.22 FPS变为5.16 FPS。
记错之后,还能把局部属性“改回来”
项目主页还展示了一个很有意思的案例:人物第一幕穿着蓝色内搭,离场后重新出现时,内搭一度变成错误的浅色花纹;随着人物在当前镜头中变得更清晰,服装颜色和纹理又恢复到历史外观,而动作、人物身份和场景没有整体重置。
作者将其解释为:当前状态越来越明确后,查询更容易对齐到正确历史,记忆敏感层据此把局部属性修正回历史外观。
一句话概括:LayerRecall追求的不是让模型回看更多,而是让它更有选择地回忆。长视频生成的下一个瓶颈,或许不在算力,而在“该记什么”这件事上。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.