网易首页 > 网易号 > 正文 申请入驻

600倍加速,720p视频实时生成!单卡也能带的动14B模型

0
分享至


新智元报道


生成一段5秒720p分辨率视频,为什么要等数十分钟?

对14B级视频生成模型来说,高分辨率、长时序和强运动一致性提升了画质,也同步拉长Token序列,放大注意力计算和显存峰值。消费级GPU必须同时面对速度与显存两道门槛。

LightX2V团队面向Wan2.2-A14B推出LightWan2.2-A14B,以步数蒸馏、NVFP4量化感知训练和动态稀疏注意力压缩计算量,再用高效算子、细粒度卸载和多卡通信优化打通整条推理链路。

最终,14B模型可以在单张RTX 5090上高效运行。

8卡生成5秒720p视频时,T2V(文生视频)仅需3.8秒、I2V(图生视频)仅需4.5秒。相较原始40步模型,最高加速分别达到705.8倍和599.3倍。

5秒视频,最快3.8秒生成。T2V与I2V双双实现720p实时生成。

787秒→2.4秒
I2V 8卡 480p

2668秒→3.8秒
T2V 8卡 720p

705.8×
8卡最高加速

787秒→10.7秒
I2V 单卡 480p

2668秒→22.5秒
T2V 单卡 720p

118.7×
单卡最高加速


项目地址:https://github.com/ModelTC/LightX2V

模型地址:https://huggingface.co/lightx2v/LightWan2.2-A14B

博客地址:https://light-ai.top/LightX2V-BLOG/posts/LightWan22-A14B/

14B视频生成的两道硬门槛

速度与显存

随着视频生成模型的能力不断增强,画面质量、运动一致性和分辨率持续提升,用户的等待时间也越来越长。以14B级视频DiT为例,生成一段5秒720p视频可能需要数十分钟。对普通用户来说,这类模型也很难直接在消费级显卡上运行。问题集中在两点:一是生成慢,二是显存装不下。

1.为什么生成慢?

去噪步数多。Wan2.2通常需要40步去噪,相当于为一条视频重复执行40次完整DiT前向,等待时间也随之累积。

单步计算重。每一步都要执行大规模矩阵乘法。随着分辨率和帧数增加,视频Token序列迅速变长,而自注意力开销随序列长度平方增长。序列长度约120K时,自注意力可占Wan2.2-A14B单次DiT延迟的80%以上。

2.为什么跑不了?

显存峰值高。14B模型权重、长视频Token、注意力缓冲区和中间激活同时占用显存,峰值容易超过约30GB消费级GPU的容量,程序会直接出现OOM。

从40步到4步

最直接的提速方式,是减少必须执行的去噪步数。LightX2V采用Phased DMD,将完整信噪比区间拆分为多个阶段,让不同专家学习不同噪声区间内的去噪行为。

训练时,每个阶段只为一个采样步保留梯度,既避免完整多步反向带来的巨大显存开销,也缓解激进一阶蒸馏容易出现的多样性下降和运动弱化。

此外,LightX2V还引入了SGMD来加快训练速度,SGMD直接推动fake score向teacher score对齐,并用teacher stop-gradient Fisher构建稳定的分布匹配目标。随后通过NR/RC双势能分别进行外循环修正和内循环跟踪,让fake score跟上持续更新的生成器。

40步压到4步,意味着最重的DiT骨干少跑36次。Wan2.2最终形成“两步高噪声专家 + 两步低噪声专家”的4步推理流程。分阶段训练同时保留视频生成所需的运动动态、视觉细节与输出多样性。


Phased DMD与直接多步蒸馏、随机梯度截断方案对比

单卡路径:把14B模型装进一张RTX 5090

4步只是第一步。

要让14B模型真正跑在单卡上,LightX2V还要继续压缩每一步的计算量、访存流量和显存峰值。

NVFP4量化感知训练。

NVFP4采用E2M1 4比特数值,并以每16个连续元素共享FP8 E4M3块级缩放、全张量再配合FP32全局缩放,在接近FP4的存储与带宽成本下保留更强动态范围。LightX2V将量化感知训练直接融入步数蒸馏,让学生模型在训练阶段就适应4比特误差,再通过CUTLASS内核映射到Blackwell Tensor Core执行,降低线性层的显存流量与GEMM延迟。

动态稀疏量化注意力。

LightX2V先用Query/Key块级均值快速估计注意力重要性,再在运行时选择关键块,仅计算被激活的注意力Tile。

典型稀疏率达到80%—90%,即只保留最重要的10%—20%块。被选中的块内部仍保持稠密计算,兼顾稀疏收益与GPU吞吐。稀疏注意力算子进一步接入SageAttention2,形成更快的FP8稀疏注意力路径。

高效推理算子。

一方面,LightX2V面向 Blackwell 架构协同优化视频DiT的两大计算热点:在线性层、MLP和MoE中,采用权重与激活双NVFP4的Block-Scaled Tensor Core GEMM,以FP32累加和BF16输出兼顾吞吐与数值稳定性,并在 CUTLASS Epilogue 中融合列偏置,显著降低显存占用和带宽开销,同时减少额外 Kernel 启动。

在长序列自注意力中,Dynamic Sparse SageAttention 根据当前 Q/K 动态评估块级相关性,仅保留约 10% 的关键注意力块,并结合Q/K INT8、V FP8低精度计算,从而同时削减密集矩阵乘和注意力计算开销,实现视频生成端到端加速。

另一方面,将3D RoPE、RMSNorm等操作替换为高效并行或融合内核,减少Python调度、临时张量和内存往返,让“主干变快之后的外围开销”不再拖慢整条链路。

异步折叠Offload。

除模型级卸载外,LightX2V进一步提供Block级卸载,按Transformer块细粒度搬运权重,并通过计算与权重搬运的异步折叠(overlap),将数据传输开销隐藏在计算过程中,以更低的峰值显存承载14B模型和长视频序列。

单卡结果:T2V 720p由2668.0秒降至22.5秒,提速118.7倍。I2V 720p由2685.0秒降至26.7秒,提速100.5倍。

相同单卡条件下,I2V 480p与720p分别约为TurboWan2.2的3.5倍和2.4倍速度。14B视频生成由此进入消费级GPU的单卡可运行范围。

多卡路径:让720p端到端实时生成

实时生成的标准很简单:生成一段5秒视频,端到端时间必须短于5秒。

LightX2V在单卡优化栈之上采用Ulysses风格序列并行,并围绕All-to-All通信、QKV布局和Head级流水继续做系统级优化,让T2V和I2V共同跨过这条线。

Light-Ulysses:面向视频生成的高效并行方案。

基础Ulysses先把长视频Token序列切分到8张GPU,再通过All-to-All在序列维和Head维之间完成数据重排,让每张卡只计算部分注意力。

LightX2V围绕这条主链路做了四层优化:通信数据直接采用FP8,同时压缩QKV交换和注意力输出回传的数据量。QKV张量融合将Q、K、V打包成一个All-to-All载荷,减少Collective调用和重复布局变换。

Triton前后处理融合内核把QKV打包、布局转换、FP8量化/反量化和输出重排放到一组高效GPU内核中。

Head Parallel则按本地Head异步发起All-to-All,在当前Head计算注意力时并行传输后续Head,并在输出阶段继续流水化回传。

这些优化被整合到同一条Ulysses执行路径中,共同减少通信量、算子启动和同步等待,把基础序列并行改造成面向视频长序列的高吞吐执行路径。

8卡结果:T2V 720p端到端延迟降至3.8秒,最高加速705.8倍。I2V 720p降至4.5秒,最高加速599.3倍。两类任务的5秒视频生成时间均短于播放时间。

性能结果


T2V方面,单卡480p与720p分别实现80.7倍和118.7倍加速,8卡720p进一步达到3.8秒与705.8倍加速。I2V方面,单卡480p与720p分别为10.7秒和26.7秒。与同为4步、同为单卡的TurboWan2.2-I2V-A14B相比,分别约快3.5倍和2.4倍。8卡I2V在720p下达到4.5秒,跨过实时生成线。

T2V与I2V可视化

T2V 可视化

I2V 可视化

快速上手官方镜像

想直接复现上述单卡与多卡性能,建议从LightX2V官方Docker镜像开始。镜像提供更稳定的依赖环境。进入LightX2V工程后,可运行以下T2V/I2V脚本:

拉取官方镜像

docker pull lightx2v/lightx2v:26052801-cu130-5090

单卡:文生视频 / 图生视频

bash scripts/wan22/extreme/run_wan22_moe_i2v_extreme.sh

多卡SP:文生视频 / 图生视频

bash scripts/wan22/extreme/run_wan22_moe_i2v_extreme_sp_parallel.sh

多GPU脚本已启用前述序列并行配置,并可按实际GPU数量设置seq_p_size。手动安装用户也可从LightX2V源码构建,并基于NVIDIA CUTLASS编译NVFP4 Kernel。

单卡T2V脚本:https://github.com/ModelTC/LightX2V/blob/main/scripts/wan22/extreme/run_wan22_moe_t2v_extreme.sh

单卡I2V脚本:https://github.com/ModelTC/LightX2V/blob/main/scripts/wan22/extreme/run_wan22_moe_i2v_extreme.sh

多卡T2V脚本:https://github.com/ModelTC/LightX2V/blob/main/scripts/wan22/extreme/run_wan22_moe_t2v_extreme_sp_parallel.sh

多卡I2V脚本:https://github.com/ModelTC/LightX2V/blob/main/scripts/wan22/extreme/run_wan22_moe_i2v_extreme_sp_parallel.sh

总结

LightX2V把14B视频生成的优化目标归纳为三个关键词:少算、少占、少等。

Phased DMD结合SGMD把Wan2.2的去噪过程从40步压缩至4步,NVFP4量化感知训练和动态稀疏注意力继续降低每一步的计算量。

CUTLASS/Triton融合内核和Block级异步Offload减少算子开销与显存峰值,使14B模型可以在单张RTX 5090上运行。多卡推理以Ulysses为主线,将FP8通信、QKV张量融合、Triton前后处理融合和Head级异步流水整合到同一执行路径,进一步降低长序列注意力的通信量和同步等待。

最终的性能表现如下:在8张RTX 5090上,5秒720p视频的端到端生成延迟降至T2V 3.8秒、I2V 4.5秒,均短于视频播放时长。相较原始40步模型,最高加速分别达到705.8倍和599.3倍。

单卡I2V在480p和720p下也分别达到TurboWan2.2约3.5倍和2.4倍的速度。720p实时生成已经成为可复现的工程结果。

参考资料:

[1] https://light-ai.top/LightX2V-BLOG/posts/LightWan22-A14B/

[2] Fan X, Qiu Z, Wu Z, et al. Phased dmd: Few-step distribution matching distillation via score matching within subintervals[C]. CVPR 2026.

[3] Wu Z, Gong R, Yong Y, et al. SGMD: Score Gradient Matching Distillation for Few-Step Video Diffusion Distillation[J]. ICML 2026.

编辑:LRST

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
卸妆后明星大变样!卤蛋脸能忍、刘亦菲黄牙能忍、鞋拔子脸忍不了

卸妆后明星大变样!卤蛋脸能忍、刘亦菲黄牙能忍、鞋拔子脸忍不了

清衣渡a
2026-10-07 18:08:09
中国男足世界排名下降至第96名

中国男足世界排名下降至第96名

极目新闻
2026-10-08 10:55:42
女教师带出5届状元班,优秀教师却落选,转身去私立,全年级挽留

女教师带出5届状元班,优秀教师却落选,转身去私立,全年级挽留

第四思维
2025-09-03 09:30:25
女子国庆期间结婚无接亲、无婚车,婚礼当天8点起床化妆,10分钟结束仪式,当事人:至少省下了1万元,准备留给蜜月旅行

女子国庆期间结婚无接亲、无婚车,婚礼当天8点起床化妆,10分钟结束仪式,当事人:至少省下了1万元,准备留给蜜月旅行

都市快报橙柿互动
2026-10-08 00:14:53
局势彻底反转了!终于轮到日本尝尝屈辱外交了

局势彻底反转了!终于轮到日本尝尝屈辱外交了

林子说事
2026-10-07 20:49:22
为什么建议老年人停止旅游?看完你就明白了啊!

为什么建议老年人停止旅游?看完你就明白了啊!

小蜜情感说
2026-10-08 16:52:45
图书馆里这位阿姨的打扮,让她看起来宛如少女,完全看不出多少岁

图书馆里这位阿姨的打扮,让她看起来宛如少女,完全看不出多少岁

美女穿搭分享
2026-10-08 11:11:53
切尔西官宣:广汽集团成为男足官方汽车合作伙伴

切尔西官宣:广汽集团成为男足官方汽车合作伙伴

懂球帝
2026-10-08 16:48:58
佩德罗宣布退役,回顾生涯却只字不提罗马

佩德罗宣布退役,回顾生涯却只字不提罗马

晚风知我意21
2026-10-08 05:50:22
差3球追平C罗,梅西退役前还有9件事没做完

差3球追平C罗,梅西退役前还有9件事没做完

元气满分吖
2026-10-08 23:23:23
你应该滚回中国去!别用亚洲人的脏习惯喂我的孩子!

你应该滚回中国去!别用亚洲人的脏习惯喂我的孩子!

网络易不易
2026-10-03 06:10:17
游客一进县城就收到文旅局长的姓名和个人手机号,工作人员:是真的,只为方便游客反映问题

游客一进县城就收到文旅局长的姓名和个人手机号,工作人员:是真的,只为方便游客反映问题

极目新闻
2026-10-06 14:50:11
蔡康永凉透,李成儒竟口碑大逆转,网友:原来你当年就看出来了!

蔡康永凉透,李成儒竟口碑大逆转,网友:原来你当年就看出来了!

老吴教育课堂
2026-10-08 12:54:58
李华月:3年连拍11部色情片,曾被称为香港的“三级女王”,现如何

李华月:3年连拍11部色情片,曾被称为香港的“三级女王”,现如何

春日在捕月
2026-10-08 15:21:28
“哥哥又闹着进妹妹屋”,特殊家庭让网友不适:放弃他吧,有危险

“哥哥又闹着进妹妹屋”,特殊家庭让网友不适:放弃他吧,有危险

熙熙说教
2026-10-08 13:58:46
高铁坐过了,千万别出站!还能免费坐回去→

高铁坐过了,千万别出站!还能免费坐回去→

极目新闻
2026-10-08 07:15:16
海南一空姐被穷打工仔追求,婚后一个月,她才得知丈夫真实身份

海南一空姐被穷打工仔追求,婚后一个月,她才得知丈夫真实身份

小月文史
2024-11-19 21:11:58
恭喜!网红大胃袋良子求婚成功,现场跪地仪式感十足,娟儿笑开花

恭喜!网红大胃袋良子求婚成功,现场跪地仪式感十足,娟儿笑开花

大眼妹妹
2026-10-09 06:28:18
机舱里撒泼的欧某某后续来了!单位一直不愿认下隐情比想象更扎心

机舱里撒泼的欧某某后续来了!单位一直不愿认下隐情比想象更扎心

南宗历史
2026-10-08 11:19:46
10月12日、10月13日连发两张王炸,比亚迪大众甩牌,车市要变天!

10月12日、10月13日连发两张王炸,比亚迪大众甩牌,车市要变天!

华庭讲美食
2026-10-09 05:50:35
2026-10-09 07:32:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16378文章数 67152关注度
往期回顾 全部

科技要闻

江淮汽车回应"尊界V800刹车踏板支架断裂"

头条要闻

女局长被举报婚内出轨至少9人 大量亲密聊天记录公布

头条要闻

女局长被举报婚内出轨至少9人 大量亲密聊天记录公布

体育要闻

30天30队·鹈鹕:胖虎又一年“如果”

娱乐要闻

演员王晓慧刚担女主,就被曝已婚生子

财经要闻

央行:中国从不搞竞争性货币贬值

汽车要闻

特别版配色/碳纤尾翼 2027款深蓝L06将于10月9日上市

态度原创

艺术
旅游
健康
公开课
军事航空

艺术要闻

炸裂!龙门石窟首次发现造像琉璃眼珠,千年佛像竟“睁眼”了,熠熠闪光品相逆天!

旅游要闻

真相来了丨网传在泰山景区躲雨每小时收费80元?景区辟谣

痘坑留下后,还能填平吗?

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美日将在距台仅110公里处演习

无障碍浏览 进入关怀版