MiniMax 发布并开源 H3 之后,全网各种玩法卷得飞起,评价蛮高。
最近我身边也有蛮多朋友在上手了 H3。聊了一圈下来,我发现不少创作者觉得 H3 的效果更有创造力、视觉冲击力也更强,同时还把价格打了下来。不过大伙儿对 H3 的架构和使用细节同样有些疑惑,希望官方能多给点信息和支持。
这不,就在这个周末,我刷到MiniMax H3 团队专门跑到 Reddit 的 StableDiffusion 社区,搞了一场 AMA(Ask Me Anything)。同一天,ComfyUI 也在自己账号上和 MiniMax 技术团队做了一场直播。
![]()
同天举办的这两场技术交流信息量很大,光 Reddit 那边就攒了 400 多条评论,开发者们聊到的重点也很有意思。
像 Reddit 这帖子里点赞最高的一条评论,是有位网友说自己没什么问题,“只想感谢你们(MiniMax 团队)开源这个模型”。结果这条热评底下,一堆网友跟着表达对 MiniMax 和开源的支持,硬是把它顶到了 400 多条回复里的第一名。
![]()
再往下翻,我看到网友们提了不少使用开源 H3 的实操问题。
首先是高分辨率视频。
有人关心高分辨率视频模型和硬件的适配度,问官方有没有相应的措施。
![]()
还有人直接问,开源版 H3 现在能生成 768P 视频,那 2K 版本官方之后会不会支持。H3 团队的回复非常笃定:会,而且不远。
![]()
模型架构,以及相关的资源占用和推理速度,也是大伙关心的重点。
有网友直接开大,问 H3 训练时用的稀疏注意力到底是什么,为什么开源推理里不用它。以及,用稀疏注意力提升推理速度的进度到底如何了。
![]()
![]()
还有不少犀利问题也在刷屏。
像为什么 H3 里的 Ref2VA(参考素材生成视频)效果明显比 i2v(图片生成视频)差,以及未来的开源计划等等,H3 团队都有回复。
这是 H3 发布后 MiniMax 团队针对这个模型第一次系统性答疑,我看了半天感觉信息量不小,所以专门挑重点捋了一遍干货放在下面。
相信看完,你也会对 H3 这个模型 以及现在视频生成模型的趋势有更清晰地了解。
AMA全文揭秘H3
H3核心架构
Q:H3 在训练后期已经使用稀疏注意力,但目前开放版本仍然以 Full Attention。H3 使用的注意力机制是 M3 上的 MSA 吗?这一方案什么时候对社区开放?
MiniMax:H3 没有使用 MSA,它的稀疏注意力策略更接近 MoBA。它的思路是利用相邻视觉 token 较高的相关性,将一组 Token 进行 mean pooling 得到 Block Representation,再利用这些表示判断哪些 Block 更重要,从而减少不必要的 Attention 计算,也不需要额外的 learned indexer。
不过,目前这套方案只对视频 token 做 3D 稀疏化,因为它们占整个 token 序列的比例最大。图像和文本 token 的稀疏也在探索范围内,团队正在持续研究中。
我们预计近期会给社区发布一个相对保守的版本,这样做的第一目标不是追求一个夸张的加速数字,而是要做到没有可感知的质量损失。如果要真正针对不同 GPU 获得最大加速,还需要进一步的硬件适配和社区参与。
Q:为什么 H3 的指令遵循能力更好,更“听话”?这是来自架构设计,还是训练方法?面对复杂的需求,为什么H3仍然能更准确地理解要求?
MiniMax:这种效果不是某一个架构技巧。本质上,最重要的因素是构建足够广泛且多样的数据集和任务,使用通用架构进行训练,并避免选择那些无法有效扩展的架构设计。为此我们在各个阶段投入了大量精力,包括数据构建、任务设计、模型架构、训练策略,确保每一个设计选择都具备良好的 Scale 能力。
还有一个观察值得一提。我们在训练模型的过程中发现,一个只训练过「根据首帧和 caption 预测末帧」这一简单任务的模型(这只是一个非常有限的时序预测任务)在没有进行任何图像编辑专项后训练的情况下,也能在多个图像编辑 benchmark 上取得较强的 zero-shot 结果。
这让我们相信,在自然语言指令引导下,原生的 in-context learning 能够泛化到不同任务。我们会在后续发布的 H3 Technical report 中公布更多细节。
Q:H3 为什么用两套独立的 VAE(视觉、音频),而不是一套联合 VAE?这样设计的考虑是什么?
MiniMax:一个重要原因是,我们想保住对多模态训练的控制权。视觉和音频一旦被编码成同一个 latent space 里的 token,就很难再通过 DiT 的训练策略去独立调节两个模态各自的训练进度。音频在这套设置里携带的信息更少,可能更早收敛、更早开始过拟合。用两套独立 VAE,我们才有足够的灵活度去平衡这种不对称。
另外,对这两套 VAE,我们的目标都不是孤立地把重建质量做到最高。我们会保证足够的基础重建效果,但更看重的是最终得到的 latent 表示对生成建模是否友好。
对视觉 VAE 来说,高压缩比能大幅减少视觉 token 数量、降低 DiT 的计算量,但一味追求重建质量对整个系统不一定最优,把太多信息塞进 latent,反而会加重 DiT 的建模负担、让它的训练行为更难控制。
有些 latent 探测结果甚至会误导人:某个表示在训练早期看着收敛很快,如果信号配比不合适,反而会更早触顶。所以我们是通过 VAE 在完整生成训练里的表现来评估它,而不是只看重建或孤立的探测指标。
推理部署还有啥优化方案
Q:H3 为什么难以运行在普通 GPU 上?目前在做哪些优化工作?
MiniMax:H3 开放系统的部分约有 600 亿参数,包括 text encoder 和 DiT model。BF16 权重约需要 120 GB 内存,而多数消费级 GPU 只有 24 GB 或更少。
我们正在做的主要优化工作包括 quantization(量化) 和 offloading(卸载):前者用更低精度存储权重,减少内存占用和数据搬运;后者把当前计算所需的部分移动到 GPU,其余保留在系统内存中。我们还发现,社区里已经有了很多在量化、加载和推理加速方面的工作流分享,欢迎大家继续探索。
大家可以先确认使用最新版本的 ComfyUI、官方 H3 workflow 和正确的 low-memory models。模型无法全部留在 VRAM 时,速度变慢是正常现象。ComfyUI 会在需要时搬运权重,实际速度还取决于系统内存和 PCIe 带宽,offloading 设置也可以带来速度与质量之间的平衡。
Q:官方会不会推出低步数(4/8 步)的版本?
MiniMax:目前发布的版本已经包含了 CFG 蒸馏。我们在最终训练阶段还引入了一种特殊策略,使模型能够以更少的推理步数运行,但这并不等于一个专门针对极低步数机制蒸馏出来的模型。
我们正在持续探索进一步的分步蒸馏,目标是在不明显降低质量的前提下降低推理成本。考虑到社区对效率的强烈需求,我们也在积极评估步数更少的版本,比如 4-NFE 或 8-NFE 版本,但短期内无法承诺会发布。
回应高分辨率与生成质量质疑
Q:H3-Regenerate-2K 到底是怎么工作的?社区测试后感觉它像是把整个基础模型当成 Upscaler 又跑了一遍,官方能确认吗?未来会开放本地版本吗?
MiniMax:它是一个二次生成阶段,但并不是简单地把已发布的 Checkpoint 当成常规 upscaler 再跑一遍。这个阶段使用了一个专门面向更高目标分辨率的 latent-space DiT regeneration checkpoint,同时把基础模型的输出当作额外的上下文信息,并提供一些更高分辨率的参考输入。
我们计划开源这个模块,但目前还在提升它的效率和质量,让它更适合社区和本地使用。这项工作还在进行中,暂时没法给出确切的发布日期。
Q:为什么 Ref2VA(参考生成)的输出质量明显比 i2v(图生视频)差?
MiniMax:是的,我们注意到了这个问题。由于训练后处理策略不同,FL2VA 和 Ref2VA 这 checkpoint 目前在视觉质量上确实存在明显差异,我们正在积极提升 Ref2VA 的画质。一个实用技巧是尽量使用最高质量的参考输入,因为 Ref2VA 对参考信号的处理质量可能比较敏感。
Q:一个反复出现的问题是,画面里较小或较远的物体会像素化、发糊,即便 2K也一样。这是为什么?
MiniMax:我们也观察到了这个问题,这会是我们接下来重点改进的方向之一。现在根据内部实验,它不能简单归因于 Visual VAE 的高压缩比,也不能准确归因于任何单一训练阶段。这是一个复杂的系统级问题,牵涉到模型和训练流程中多个部分的交互。我们还在继续定位主要影响因素,会在未来的更新里改进。
Q:有没有可能用循环续接的方式,生成远超原生 15 秒窗口的长视频?H3 训练时接触过这种续接分布吗?
MiniMax:我们最初确实训练过一个用扩展 RoPE 位置的专门音视频续接任务,作为独立任务,它表现得非常好。但我们发现这种 RoPE 扩展方式在多任务环境下泛化能力较弱,也不太容易自然地融进通用的上下文生成框架里。
所以,发布的模型改成了通过标准的参考条件方式来学习续接,Ref2VA 会把前面的内容当作参考条件来支持延续。当前模型还没有针对「包含多段循环续接的长轨迹」做原生训练。要做到真正的循环续接,我们认为用稀疏注意力做原生长轨迹训练是一个很有前景的方向,它能显著降低这类训练的计算成本,也有助于减少循环窗口之间逐渐累积的质量和一致性下降。
未来的模型路线与开源计划
Q:你们之后是否会发布 Context-IR 的模板?还有哪些使用技巧?
MiniMax:我们发布过两份官方提示词指南,已经提供模板示例,也将这两份指南整合成了一个 GitHub Skill 并持续迭代。想获得最完整、原生的 Context-IR 体验,建议直接使用官方 API。
本地部署用户,T2V 是最容易上手的模式,因为只需要文本 prompt,H3 Context-IR API 则可以进一步增强用户的 prompt,帮助生成更好的视频。ComfyUI 用户可以从官方模板开始尝试构建,熟悉后再逐步加入参考图像、音频和镜头控制等功能。
Comfy 团队在直播中也给出了一些使用技巧。例如,输入音频参考时,如何让对白和画面更稳定?建议把输入音频作为 reference,同时在 prompt 中用引号写出角色需要说的对白,并放在对应镜头的描述中。这样通常能提升对白生成的稳定性和一致性。
而对于很多人提问的多镜头产品广告工作流,搭建的方法也并不复杂:可以用输入参数定义视频时长和镜头数量,例如 10 秒、5 个镜头,平均每个镜头约 2 秒;再通过 LLM prompt enhancer 生成预览 prompt,并传入多个参考画面。ComfyUI 模板库已经提供了相应的基础工作流,用户可以自行调整镜头、参考输入和提示词。
Q:能不能把 H3 用作图像生成/编辑,只出一帧,变成流式视频生成模型?
MiniMax:H3 不是流式视频生成模型,所以它没法先生成一个「预览帧」,再把同一次生成延续成视频。更合适的流程是先用一个图像模型生成第一帧,再用 H3 的 I2VA 模式生成视频。
Q:未来会不会基于H3推出图像模型?
MiniMax:会。我们计划开源一个统一的模型,同时用于文生图和通用图像编辑。它与 H3 共享相同的底层架构,我们目前正在完善和优化它的后训练阶段。
也就是说,我们正在从 H3 模型谱系推导出一个专用的图像模型,希望提供给社区。它会复用和 H3 相同的 VAE 编码器:这个图像模型会沿用 H3 的 VAE Encoder 架构。由于 H3 的 Temporal Encoder 是 Causal 的,团队可以通过 Weight Slicing 获得一个二维 VAE Encoder。但同时,我们还计划为图像生成模型提供一个专门设计的 VAE 解码器。
Q:MiniMax 在未来还会继续开源吗?对语音、音乐模型有没有后续的开源计划?如何确定优先级?
MiniMax:在 H3 发布后很短的时间里,开发社区已经有了不同量化版本、ComfyUI 适配和 MLX 等硬件支持。对 MiniMax 来说,这种快速迭代和探索,正是开放协作能够带来的价值。
我们的愿景是 Intelligence with Everyone,推动这一领域的发展是我们的核心使命之一。我们会持续认真思考,如何作出最有意义的贡献,同时密切关注社区反馈,并在共同前进的过程中保持开放。
对于后续模型,我们当前的优先级仍然是,在实际可用、资源可接受的前提下持续提供更强的能力。
H3开源后,社区和创作者已玩嗨
看完 H3 的这次 AMA,我有一种很清晰的感觉:MiniMax 对开源这件事,有着自己的节奏。
虽然这次 H3 系统的三个模块并未完全开放,但从交流里能看出,团队一直在摸索更适合社区使用的版本,对社区需要的 infra 支持也有长期规划。
而 H3 目前的开源进度,已经足以让全球开发者和创作者玩起来了。各种创意工作流、教程和新玩法不断涌现。
比如模型一出来,ComfyUI 社区就实测出了运行 H3 的最低配置。
![]()
也有博主发布了低显存玩家使用 H3 的详细教程。
![]()
围绕 H3 的提示词教程和创作案例,更是铺天盖地。
![]()
MiniMax 官方也亲自下场,整理了更多玩法和教程:https://hailuoai.com/h3-open。
这些都说明,H3 的这次开源,真实地让大伙把视频模型玩出了花。
在官方、开发者和创作者的共同努力下,顶尖视频模型与普通人之间的距离,正在一点点缩短。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.