2026年8月13日,HeyGen的AI视频生成平台迎来一次关键升级。其核心模型Avatar IV——一个驱动数字人说话的扩散模型栈——拥有超过180亿参数。通过与Google Cloud的AI基础设施性能优化团队合作,HeyGen将这一模型部署到八芯片Trillium(v6e)主机上,推理速度比首个可用版本提升了1.86倍。 流式视频渲染从不等人。Avatar IV逐块生成说话视频,任何一个数据块延迟,都会导致画面卡顿。因此,每一次性能优化都必须在截止时间前完成。最终结果不仅是速度翻倍,更是在所有质量门禁测试均通过的前提下实现的。 这次优化面临三道难关。第一,网格内全对all-to-all集合通信完全暴露,成为性能瓶颈;第二,稀疏注意力网格中的部分块处理异常复杂;第三,softmax内循环存在串行依赖,限制了并行计算效率。文章将逐一拆解这三道障碍,并介绍背后的编译器契约与质量保障机制。 Avatar IV的工作流程是把一张静态照片和一段音频转化为会说话、会动的人物。整个管线中,三个模型轮流处理每个视频块:一个扩散Transformer根据音频渲染动作,一个次级Transformer负责超分辨率处理,最后由VAE解码器将隐空间数据转换为像素。最终输出为720p或1080p、每秒25帧的视频,并以分块流式传输,播放器可在后续块仍在渲染时先行播放。 在Trillium主机上运行的Avatar IV管线,由两个扩散Transformer和一个VAE解码器按序协力处理每一块视频内容。模型权重采用FSDP分片,序列则通过Ulysses在八芯片网格中分片。 Avatar IV最初为GPU架构设计,整个AI生态亦是如此。这次迁移经由torchax完成——这是PyTorch在JAX上的前端:生产模型代码无需修改,即可调度到JAX数组上,并由XLA编译器统一编译。同一套模型代码现在同时支持GPU与Trillium双后端,为后续扩展奠定了基础。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.