前几天我实测了 MiniMax H3,当时就被惊艳到了,输出效果与顶级闭源AI视频生成模型不相上下
昨天 MiniMax 团队在Reddit 的 r/StableDiffusion 频道举办了AMA活动,MiniMax H3团队成员们解答了很多开发者的疑惑,很多内容都是之前没有公开的。我记录下了自己很感兴趣的部分,分享给大家
按 Artificial Analysis 的第三方盲测,H3 已经进入全球 AI 视频第一梯队,更是毫无争议的开源模型No1。
我看很多回复,感觉老外很擅长不吝啬赞美,讨论氛围也很好
![]()
那个负责最终 2K 输出的模型,到底会不会放出来
H3 发布时给出的 2K 方案,官方叫 In-context Regeneration。这套东西跟视频模型常见的独立超分路线是两码事:模型带着原有的多模态上下文,把低分辨率结果重新生成一遍高分辨率版本,文字、纹理这些细节是重新"生成"出来的,跟超分算法拿低分辨率像素去猜,完全两个路子
所以有开发者问:H3-Regenerate-2K 什么时候开?它是普通超分吗?
![]()
官方的回答简短得有点意外:会,而且不会太久,H3-Regenerate-2K 本质上是第二阶段的条件生成,它并不是把现在这版 H3 Base Checkpoint 再跑一遍,跟传统意义上的 Upscaler 也是两回事。这个阶段用的是一个专门面向更高目标分辨率的权重,基础模型先前生成的内容会作为额外上下文喂进去,同时一部分参考输入会以更高分辨率提供给模型
H3 用的是 M3 那套 MSA 吗,Sparse Attention 什么时候开
H3 训练后期已经用上了稀疏注意力,但开放出来这一版推理仍然走 Full Attention。分辨率和时长一往上抬,attention 的计算和显存开销就疯长,所以这块被不少开发者视为 H3 后续最重要的本地推理优化
有人问技术报告里提到原生稀疏注意力能大幅压低长上下文的内存开销,可开源版本没带,MSA 会开吗?如果不开,fp8 加分阶段加载是不是面向消费级硬件的长期方向?
![]()
回答先把提问的前提给拆了:H3 压根没用 MSA
它走的是MoBA 式的块选择,原因是相邻的视觉标记本身就具有高度相关性,因此均值池化的块表示可以有效地探测块的重要性,而无需额外的学习索引器。目前仅将 3D 稀疏化应用于视频标记,同时也在探索将图像和文本标记作为未来的候选项
MiniMax 计划近期给社区一个相对保守的SparseAttention参考实现,第一目标是做到没有可感知的质量损失,加速数字排在后面。真想在不同 GPU 上榨出最大加速,还得靠进一步的硬件适配和社区参与
会不会出官方 TurboLora?
H3 开放之后,第三方 Turbo LoRA 冒出来的速度非常快,LightX2V 甚至已经放出了 4-step Turbo LoRA 的预览版。所以有人干脆问官方,会不会出个自家的 4-step 或 8-step
![]()
团队先解释了一件很多人不知道的事:现在这版 H3 本身就带了CFG蒸馏,最终训练阶段还用了一种特殊策略,所以它本来就具备一定的低步数推理能力
但它并不是专门冲着极低步数蒸馏出来的模型
至于官方 Turbo,MiniMax 说正在积极考虑 4-NFE 或 8-NFE 这样的低步数版本,默认目标是先把推理成本压下来,同时尽量不让用户感知到质量下降。不过团队也把话说清楚了:短期内没法承诺
这个态度跟社区当下的实践形成了挺有意思的反差
第三方 Turbo LoRA 已经能用了,有测试过的人反馈称,步数砍得狠,人体结构和运动质量明显退化,有人跑 LightX2V 4-step 早期版本时连音频质量都跟着崩了。MiniMax 在交流中说,重点仍是在降低部署的同时控制质量损失
会不会出个更小的 H3,好让消费级显卡轻松点?![]()
答案是近期没这个计划
团队给的替代方案是把活儿交给社区:可以试试结构化块剪枝(structured block pruning)这类办法,剪完再通过恢复训练或者蒸馏把小模型拉回来
这条回答的信息量其实在言外之意里——官方短期内不会为小显存单独开一条训练线,消费级显卡上的可用版本,得靠开源生态自己动手
Ref2VA 为什么比 I2V 更容易糊
同样的分辨率和步数下,Ref2VA 的输出画质明显比 FL2VA 更容易退化,用 Driving Video 当动作参考时尤其明显,远景人物和高频纹理会出现涂抹感,怎么解决呢?
![]()
团队这次没把锅推给 Prompt。回答里确认,FL2VA 和 Ref2VA 在视觉质量上的表现倾向确实存在明显差异,其中一个原因来自二者不同的 后训练策略,他们正在主动改善 Ref2VA 的画质
眼下能用的实际建议只有一条:参考输入的质量拉到最高,因为 Ref2VA 对参考条件本身的质量比较敏感
这个回答的价值在于把责任归位了——至少有一部分问题确实来自模型自身,跟"用户不会写 Prompt"没关系
靠拼接在本地跑出 60 秒长视频,这算不算野路子
H3 单次生成上限是 15 秒,但社区里已经有人把它拼到 60 秒了
具体做法是连续生成,每段 141 帧,把上一段的最后 51 帧连同音频一起当作参考喂给下一段。如果全程用同一张主体参考图,理论上还能一直接下去。麻烦在两处:连贯的提示词得一段段手写,而且模型只看得到此前 51 帧,衔接处难免翻车
![]()
团队的回答给这套操作正了名:这个能力来自预训练,模型在预训练阶段就基于 RoPE 扩展做过音视频连续性的训练,并且以先前片段和文本提示为条件。最终发布的模型保留了其中一部分,而这套工作流正好是对它的绝佳展示
换句话说,长视频拼接压根不是钻空子,是官方原本就埋在模型里的能力,社区只是先一步把它挖出来用上了
还有很多问题都特别硬核,涉及模型训练细节了,比如RL/DPO、训练阶段、图像与视频比例、分辨率与时长分布、蒸馏方式、评测集、数据构造等等
![]()
团队的回复:后续会发布 H3 开发的完整技术报告
最后用 MiniMax 在AMA中的一句回复收个尾吧:"Keep open until AGI arrived"
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.