谢赛宁在社交平台转发介绍了V-RAE。这个模型没有走传统VAE潜空间的路子,而是直接把冻结的视觉基础模型表征拿来当视频生成潜空间。
用现成表征替代VAE潜空间
![]()
具体来说,V-RAE采用的表征来自DINOv3、SigLIP2、EUPE和V-JEPA 2.1。这些视觉基础模型被冻结后,其输出直接作为视频生成的潜空间使用。
匹配设置下指标表现
在匹配设置下,V-RAE在Kinetics-600上达到2.13 rFVD,在UCF101上达到117.86 gFVD。收敛速度方面,比VAE潜空间快6倍。
此外,V-RAE还引入了tFVD来评估时序平滑度。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.