北大-兔展AIGC联合实验室共同发起的复现OpenAI公司的sora 的开源Open-Sora-Plan v1.0.0模型(CausalVideoVAE v1.0.0)正式发布,大大提高了视频生成质量和文本控制能力
现在可以生成 10 秒(OpenAI的sora可以生成1分钟高清视频)、24 FPS 的 1024×1024 视频。而且还能够生成高分辨率图像。Open-Sora-Plan v1.0.0模型还支持了国产AI芯片华为昇腾910b训练与推理,接下来还会支持更多国产AI芯片
Open-Sora-Plan v1.0.0 有以下特点:
使用 CausalVideoVAE 进行高效训练和推理,对视频进行 4×8×8 的时空压缩
联合图像视频训练以获得更好的质量。CausalVideoVAE 将第一帧视为图像,允许以自然的方式同时编码图像和视频。这使得扩散模型能够掌握更多的空间视觉细节,从而提高视觉质量
open-sora 65×512×512 生成文本到视频
open-sora 1536×1024高清图像生成
Open-Sora1.0模型技术细节
open-sora 1.0模型的CausalVideoVAE 架构继承自 Stable-Diffusion Image VAE。为了保证Image VAE的预训练权重能够无缝应用到Video VAE中
模型结构进行了如下设计:
CausalConv3D:将Conv2D转换为CausalConv3D可以实现图像和视频数据的联合训练。 CausalConv3D 对第一帧进行特殊处理,因为它无法访问后续帧
初始化:Conv2D扩展到Conv3D常用的方法有两种:平均初始化和中心初始化。采用了特定的初始化方法(尾部初始化)。这种初始化方法确保模型无需任何训练就能够直接重建图像,甚至视频
模型架构如下:
模型推理技巧:
尽管在扩散训练中,变分自编码器(VAE)被冻结了,但研究人员仍然发现运行CausalVideoVAE的推理成本相当高。具体来说,在拥有80GB GPU内存的情况下,仅能使用半精度处理256×512×512或32×1024×1024分辨率的视频,这限制了对更长和更高分辨率视频进行扩展的能力。因此,北大团队采用了一种名为“tile convolution”(瓦片卷积)的技术,它能够在几乎不变的内存消耗下,对任意时长和任意分辨率的视频进行推理。通过这种方法,克服了硬件资源限制,实现了对更复杂视频数据的高效处理
长视频生成技术:
随着视频持续时间的增长,传统的基于大规模多模态图像模型来生成视频描述的方式可能会遇到效率瓶颈,无法有效地处理长视频的场景。因此,北大团队正在研发一种新的视频字幕生成流水线系统,该系统特别强化了对长视频的支持,旨在提高此类视频的自动描述生成效率与质量
研发团队对于他们正在开发的这一新型视频字幕生成管道感到非常兴奋,并预告在不久的将来会进一步分享更多有关这项技术的具体内容和进展,邀请大家继续保持关注
结语
本项目希望通过开源社区的力量复现Sora,仍需持续完善和快速迭代,团队承认尽管 v1.0.0 已经显示出令人鼓舞的结果,但要达到 OpenAI Sora 的水平,还有很长的路要走
目前CausalVideoVAE(v1.0.0)发布的版本有两个主要缺点:运动模糊和网格效果
超过 60% 的训练数据集由风景视频组成。因此open-sora 1.0在其他领域生成视频的能力是有限的,团队正在推进新的方法收集高质量视频数据
详细技术报告:
https://github.com/PKU-YuanGroup/Open-Sora-Plan/blob/main/docs/Report-v1.0.0.md
⭐星标AI寒武纪,好内容不错过⭐
用你的赞和在看告诉我~
开源的力量
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.