扩散变换器(DiTs)开启了视频生成的新纪元。尽管这些模型取得了很大进展,但它们在捕捉重要细节方面仍然存在一些困难。视频增强可能是一个直观的解决方法,主要有两个目标:1. 保持一致性;2. 提高视觉质量。在其中,时间注意力(temporal attention)起着至关重要的作用,它帮助确保视频帧之间的一致性,同时保持细节。通过可视化揭示了一个关键发现:视频帧之间的注意力权重(非对角线部分)明显低于对角线上的权重,这可能导致帧之间的一致性问题。
那么,是否可以通过利用时间注意力来提高视频质量呢?受到上述分析的启发,时间注意力的温度值决定了帧间关联的强度。较高的温度值能让模型关注更广泛的时间上下文。新加坡国立大学和上海AI Lab首次提出了一种无需训练的增强方法Enhance-A-Video,可以直接应用于现有的视频模型,通过调整时间注意力的输出。(链接在文章底部)
01 技术原理
帧之间的一致性,类似于大语言模型(LLMs)中令牌(tokens)之间的一致性。在LLMs中,温度参数(tau)用于控制注意力分布,平衡聚焦与多样化的令牌选择。为了更好地理解时间注意力的作用,通过可视化不同模块中的时间注意力模式来进行分析。
具体来说,Enhance-A-Video设计了一个增强模块(Enhance Block),作为并行分支。这个分支计算时间注意力图中非对角线元素的平均值,作为帧间强度(CFI)。然后,使用增强的温度参数乘以CFI,从而增强时间注意力的输出效果。
温度值的提高会带来更多的细节和创意。然而,温度过高则会导致内容不合逻辑,并可能造成视频失真。因此在使用视频生成时要控制好温度的设定。
通过视频可以看到,随着温度设置的增加,视频画面出现部分模糊和不自然抖动。
02 演示效果与对比
2024年12月20日:Enhance-A-Video已支持CogVideoX和HunyuanVideo。2024年12月22日:Enhance-A-Video在LTX-Video上取得了进展,并已加入到ComfyUI-LTX中。
基于Hunyuan的视频增强:
基于CogVideoX-2B的视频增强:
基于Open-Sora v1.2的视频增强:
https://github.com/NUS-HPC-AI-Lab/Enhance-A-Video
https://github.com/logtd/ComfyUI-LTXTricks
https://github.com/kijai/ComfyUI-HunyuanVideoWrapper
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.