当前,动态新视角合成(Dynamic Novel View Synthesis, Dynamic NVS)正逐渐从离线场景重建迈向在线视频流应用。在此类场景中,系统不仅需要基于当前多相机输入生成目标视角,还需要在人物运动、遮挡以及视角切换过程中持续保留历史观测中的纹理与空间信息,因此长时记忆能力成为动态新视角合成的关键挑战。现有方法要么缺乏有效记忆机制,无法恢复被遮挡区域;要么依赖逐帧测试时训练(Test-Time Training, TTT)更新状态,导致计算开销较高并易出现长期记忆漂移。
针对这一问题,本文介绍一篇由University of Washington 与 Google联合完成的工作,本文提出 Neural Space-Time Memory (NSTM) 框架,该方法通过神经空间时间记忆机制持续编码动态场景历史信息,并提出记忆更新与视角合成解耦策略,仅周期性更新记忆状态,再利用跨视角注意力融合当前运动信息与历史上下文。此外,论文进一步引入了辅助记忆监督和内存缓存机制,以提升长期记忆稳定性。实验结果表明,NSTM在 MVHumanNet++动态人体新视角合成任务中实现了分钟级历史信息保持,在长期遮挡测试中优于LVSM、LaCT-NVS等方法,并兼具实时推理能力。
![]()
论文题目:
Online Neural Space Time Memory for Dynamic Novel View Synthesis
文章链接:
https://arxiv.org/abs/2607.15271
项目主页:
https://nst-mem.github.io
一、研究背景和动机
在线动态新视角合成的输入为连续多视角视频流,每一时刻需从未观测的目标视角合成对应图像。与静态场景或离线重建不同,动态人体场景中存在持续运动、局部遮挡以及外观信息的间歇性可见性变化”。以人物背部图案为例,系统可能只在最开始看到背面,随后几十帧输入都只来自正面相机。如果模型没有稳定记忆,它就只能根据当前可见区域猜测背面纹理。
![]()
如上图所示,本文提出的NSTM的核心考量不仅是单帧重建质量,更在于长序列中记忆是否能够被可靠保持。上图左侧示例展示了早期背部观测与随后正面输入之间的时序依赖,右侧曲线则揭示了另一关键约束:若将所有历史观测直接输入Transformer注意力,推理延迟将随序列长度线性增长,而实际在线系统要求在整个视频流中维持稳定的帧率。
二、方法
![]()
本文方法的核心目标是为动态新视角合成构建一个可更新、可读取的神经时空记忆。如上图所示,NSTM采用交替训练策略:在偶数时间步执行记忆监督,强制模型仅依赖记忆恢复目标视角。在奇数时间步执行合成监督,允许目标token结合当前输入与上一轮记忆进行联合合成。
2.1 问题形式化
在每个时间步 ,模型观察到 个输入视角:
其中, 是输入图像, 是对应相机位姿。NSTM 的目标是在给定目标相机 、当前观测 和上一时刻累积记忆 时合成目标图像:
其中, 不是常规网络参数,而是一组会在推理时更新的快权重。
2.2 解耦记忆
传统测试时训练(Test-Time Training, TTT)方法通常将记忆更新与记忆应用紧耦合。一方面,基于分块并行的方案依赖块级缓存,会引入额外等待延迟。另一方面,逐帧执行梯度更新又会造成较高计算成本,单步更新耗时约 58 ms,难以满足实时推理需求。为解决上述问题,NSTM 将记忆更新频率与视角合成频率解耦,将在线推理划分为两个异步过程:
•周期性记忆步骤(Periodic Memorization Step):仅在需要将新观测压缩至快速权重时触发记忆更新,避免逐帧优化带来的计算负担。
•逐帧合成步骤(Per-frame Synthesis Step):每个时间步基于持久记忆状态 进行轻量级查询。由于记忆更新具有周期性,历史状态与当前观测之间存在时序偏差,NSTM进一步引入跨视角注意力,融合当前运动信息与历史上下文,从而实现高效且实时的新视角合成。
2.3 解耦内存
在视频中,物体从遮挡到可见的发生频率较低,导致相关的监督信号较为稀疏,若将跨视角注意力与记忆模块联合训练,网络易过度依赖当前输入而绕过记忆。为此,本文提出交替训练策略,在偶数时间步( ),引入仅表示目标相机光线的记忆读取token,其注意力掩码被限制为仅自注意力,完全隔离当前输入。这些token查询更新后的记忆状态,生成完全依赖历史上下文的图像 ,由辅助损失监督:
在奇数时间步( ),目标token自由地与输入 进行跨视角注意力,同时查询上一轮记忆 ,监督合成输出:
交替进行至全部 帧,总损失平衡两项任务:
训练采用1:1交替,推理时可在两次记忆更新间执行多次合成,因为同一冻结记忆下的各合成步骤彼此独立,性能不会下降。
2.4 用内存缓存抑制长期漂移
![]()
测试时训练方法在长期更新过程中会受到 RNN 漂移的影响。上图中的 LaCT-NVS 列展示了观察到了的这种现象,表现为由优化不稳定引起的记忆衰减。NSTM 引入了内存缓存机制,用当前记忆与过去若干缓存记忆的平均状态共同参与读取。论文将每隔 步得到的历史记忆维护为递推平均:
在时间步 ,实际用于读取的聚合记忆为:
实现上仅需额外保存一组平均快权重 ,记忆规模不随历史长度线性增长。更重要的是,Memory Caching 仅在 NSTM 的解耦架构下有效。若直接应用于更新与读取耦合的 LaCT-NVS,平均快权重会混合不同历史姿态,导致输出冻结在过往姿势上。NSTM 借助跨视角注意力显式对齐当前运动,因而可将缓存记忆作为外观与几何先验,而非直接作为当前姿态使用。
三、实验结果
论文旨在系统验证 NSTM 是否能在长时遮挡记忆、自然旋转场景、通用新视角合成与实时推理之间取得平衡。作者采用MVHumanNet++数据集,该数据集包含60,000条多视角人物运动序列、4,500个身份和9,000套服装(总帧数达6.45亿),按90%/10%划分训练/测试集,主实验在256×256分辨率、单张H100上评估,筛选后测试集包含390个有效场景。对比方法包括无状态的LVSM[1]、改造成因果动态NVS的LaCT-NVS[2],以及基于CUT3R持久token记忆改造的Token-Mem[3]。所有有状态模型均采用两阶段课程训练(4帧预训练,24帧微调),实验涵盖记忆压力测试、自然旋转记忆测试与通用新视角合成测试,以全面衡量模型的记忆持久性与泛化能力。
3.1 定量分析
![]()
上表展示了本文方法与其他方法的定量比较结果。作者在390个场景上评估了模型在T=4、30、60三个时刻的记忆保持能力。结果显示,NSTM在所有时间范围内均保持mPSNR高于20 dB,而LaCT-NVS和Token-Mem分别从T=4到T=60下降了5.47 dB和1.56 dB,退化明显。相比之下,无状态的LVSM因缺乏历史记忆,在仅提供正面视图时无法重构背面细节,且性能基本不随时间变化。
3.2 定性分析
![]()
上图展示了在自然旋转序列上本文方法与基线模型的定性比较结果。这些序列中人物背部随时间自然显现,模型需从当前输入中恢复相应背部纹理。如左侧列标注,各阶段背部可见性对应不同时间步。结果显示,NSTM能够有效召回服饰图案等细节纹理。相较之下,无状态LVSM无法合成未见过的背部内容,而LaCT-NVS与Token-Mem则表现出明显的记忆退化现象。
3.3 消融实验
![]()
论文通过60帧遮挡压力测试对模型各组件进行消融分析,结果如上表所示。采用内损失可显著缓解快权重更新的不稳定性,将耦合架构LaCT-NVS的PSNR从22.32提升至27.77,增益达5.45dB。然而,在此耦合架构上直接叠加 Memory Caching,PSNR反而降至20.25,表明缓存机制依赖于更新/合成解耦与跨视角注意力协同。就 NSTM 而言,移除辅助记忆损失后PSNR为28.23,引入记忆监督后,即便无缓存,PSNR升至29.24。
3.4 推理性能分析
![]()
上表分析了 NSTM 的推理效率。在 256×256 分辨率、单张 H100 GPU 上,一次完整记忆更新耗时 58.14 ms(约 17 FPS),而单次视图合成仅需 27.01 ms(约 37 FPS)。考虑到视频流相邻帧之间的高冗余性,NSTM 采用 1 FPS 记忆更新 + 30 FPS 视图合成 的异步策略,摊销后单帧延迟约为 28.1 ms。相比需要处理全部历史观测的 Temporal-LVSM,NSTM 将历史信息压缩至固定大小的快速权重,使推理延迟不随序列长度增长。
四、总结
本文提出的 NSTM,为在线动态新视角合成提供了一种面向流式视频输入的长时记忆机制。其核心思想不再依赖不断增长的 token 序列维护历史上下文,而是通过 TTT 快权重将历史外观与几何信息编码至模型参数中,并借助解耦的合成过程在每帧实现高效记忆读取。实验表明,NSTM 在强遮挡与自然旋转场景中均能更稳定地恢复人物背部细节,同时保持接近 LVSM 的通用新视角合成能力,并支持约 30 FPS 的摊销实时推理。此外,本文也指出了目前方法存在的若干局限,周期性更新可能遗漏相邻更新间隔内的短暂事件,有限记忆容量存在饱和风险,以及早期记忆偏置对后续表示的影响。
参考
[1] Jin H, Jiang H, Tan H, et al. Lvsm: A large view synthesis model with minimal 3d inductive bias[J]. arXiv preprint arXiv:2410.17242, 2024.
[2] Tianyuan Zhang, Sai Bi, Yicong Hong, Kai Zhang, Fujun Luan, Songlin Yang, Kalyan Sunkavalli, William T Freeman, and Hao Tan. Test-time training done right. arXiv preprint arXiv:2505.23884, 2025.
[3] Qianqian Wang, Yifei Zhang, Aleksander Holynski, Alexei A. Efros, and Angjoo Kanazawa. Continuous 3D Perception Model with Persistent State . In 2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 10510–10522, Los Alamitos, CA, USA, 2025. IEEE Computer Society.
Illustration From IconScout By IconScout Store
9月28日晚@美国匹兹堡
「IROS 2026 群星闪耀 精英晚宴」
免费报名,期待线下见面!
北京时间9月25日(周五) 12:00截止报名
-The End-
本周上新!
扫码观看!
“AI技术流”原创投稿计划
TechBeat是由将门创投建立的AI学习社区(www.techbeat.net)。社区上线700+期talk视频,3000+篇技术干货文章,方向覆盖CV/NLP/ML/Robotis等;每月定期举办顶会及其他线上交流活动,不定期举办技术人线下聚会交流活动。我们正在努力成为AI人才喜爱的高质量、知识型交流平台,希望为AI人才打造更专业的服务和体验,加速并陪伴其成长。
投稿内容
// 最新技术解读/系统性知识分享 //
// 前沿资讯解说/心得经历讲述 //
投稿须知
稿件需要为原创文章,并标明作者信息。
我们会选择部分在深度技术解析及科研心得方向,对用户启发更大的文章,做原创性内容奖励
投稿方式
发送邮件到
yimingzhang@thejiangmen.com
或添加工作人员微信(aceyiming)投稿,沟通投稿详情
关于我“门”
将门是一家以专注于数智核心科技领域的新型创投机构,也是北京市标杆型孵化器。 公司致力于通过连接技术与商业,发掘和培育具有全球影响力的科技创新企业,推动企业创新发展与产业升级。
将门成立于2015年底,创始团队由微软创投在中国的创始团队原班人马构建而成,曾为微软优选和深度孵化了126家创新的技术型创业公司。
如果您是技术领域的初创企业,不仅想获得投资,还希望获得一系列持续性、有价值的投后服务,欢迎发送或者推荐项目给我“门”:
bp@thejiangmen.com
![]()
点击右上角,把文章分享到朋友圈
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.