网易首页 > 网易号 > 正文 申请入驻

H3刷屏后,MiniMax连续两场直播回应外界一切好奇

0
分享至

MiniMax 发布并开源 H3 之后,全网各种玩法卷得飞起,评价蛮高。

最近我身边也有蛮多朋友在上手了 H3。聊了一圈下来,我发现不少创作者觉得 H3 的效果更有创造力、视觉冲击力也更强,同时还把价格打了下来。不过大伙儿对 H3 的架构和使用细节同样有些疑惑,希望官方能多给点信息和支持。

这不,就在这个周末,我刷到MiniMax H3 团队专门跑到 Reddit 的 StableDiffusion 社区,搞了一场 AMA(Ask Me Anything)。同一天,ComfyUI 也在自己账号上和 MiniMax 技术团队做了一场直播。


同天举办的这两场技术交流信息量很大,光 Reddit 那边就攒了 400 多条评论,开发者们聊到的重点也很有意思。

像 Reddit 这帖子里点赞最高的一条评论,是有位网友说自己没什么问题,“只想感谢你们(MiniMax 团队)开源这个模型”。结果这条热评底下,一堆网友跟着表达对 MiniMax 和开源的支持,硬是把它顶到了 400 多条回复里的第一名。


再往下翻,我看到网友们提了不少使用开源 H3 的实操问题。

首先是高分辨率视频。

有人关心高分辨率视频模型和硬件的适配度,问官方有没有相应的措施。


还有人直接问,开源版 H3 现在能生成 768P 视频,那 2K 版本官方之后会不会支持。H3 团队的回复非常笃定:会,而且不远。


模型架构,以及相关的资源占用和推理速度,也是大伙关心的重点。

有网友直接开大,问 H3 训练时用的稀疏注意力到底是什么,为什么开源推理里不用它。以及,用稀疏注意力提升推理速度的进度到底如何了。



还有不少犀利问题也在刷屏。

像为什么 H3 里的 Ref2VA(参考素材生成视频)效果明显比 i2v(图片生成视频)差,以及未来的开源计划等等,H3 团队都有回复。

这是 H3 发布后 MiniMax 团队针对这个模型第一次系统性答疑,我看了半天感觉信息量不小,所以专门挑重点捋了一遍干货放在下面。

相信看完,你也会对 H3 这个模型 以及现在视频生成模型的趋势有更清晰地了解。

AMA全文揭秘H3

H3核心架构

Q:H3 在训练后期已经使用稀疏注意力,但目前开放版本仍然以 Full Attention。H3 使用的注意力机制是 M3 上的 MSA 吗?这一方案什么时候对社区开放?

MiniMax:H3 没有使用 MSA,它的稀疏注意力策略更接近 MoBA。它的思路是利用相邻视觉 token 较高的相关性,将一组 Token 进行 mean pooling 得到 Block Representation,再利用这些表示判断哪些 Block 更重要,从而减少不必要的 Attention 计算,也不需要额外的 learned indexer。

不过,目前这套方案只对视频 token 做 3D 稀疏化,因为它们占整个 token 序列的比例最大。图像和文本 token 的稀疏也在探索范围内,团队正在持续研究中。

我们预计近期会给社区发布一个相对保守的版本,这样做的第一目标不是追求一个夸张的加速数字,而是要做到没有可感知的质量损失。如果要真正针对不同 GPU 获得最大加速,还需要进一步的硬件适配和社区参与。

Q:为什么 H3 的指令遵循能力更好,更“听话”?这是来自架构设计,还是训练方法?面对复杂的需求,为什么H3仍然能更准确地理解要求?

MiniMax:这种效果不是某一个架构技巧。本质上,最重要的因素是构建足够广泛且多样的数据集和任务,使用通用架构进行训练,并避免选择那些无法有效扩展的架构设计。为此我们在各个阶段投入了大量精力,包括数据构建、任务设计、模型架构、训练策略,确保每一个设计选择都具备良好的 Scale 能力。

还有一个观察值得一提。我们在训练模型的过程中发现,一个只训练过「根据首帧和 caption 预测末帧」这一简单任务的模型(这只是一个非常有限的时序预测任务)在没有进行任何图像编辑专项后训练的情况下,也能在多个图像编辑 benchmark 上取得较强的 zero-shot 结果。

这让我们相信,在自然语言指令引导下,原生的 in-context learning 能够泛化到不同任务。我们会在后续发布的 H3 Technical report 中公布更多细节。

Q:H3 为什么用两套独立的 VAE(视觉、音频),而不是一套联合 VAE?这样设计的考虑是什么?

MiniMax:一个重要原因是,我们想保住对多模态训练的控制权。视觉和音频一旦被编码成同一个 latent space 里的 token,就很难再通过 DiT 的训练策略去独立调节两个模态各自的训练进度。音频在这套设置里携带的信息更少,可能更早收敛、更早开始过拟合。用两套独立 VAE,我们才有足够的灵活度去平衡这种不对称。

另外,对这两套 VAE,我们的目标都不是孤立地把重建质量做到最高。我们会保证足够的基础重建效果,但更看重的是最终得到的 latent 表示对生成建模是否友好。

对视觉 VAE 来说,高压缩比能大幅减少视觉 token 数量、降低 DiT 的计算量,但一味追求重建质量对整个系统不一定最优,把太多信息塞进 latent,反而会加重 DiT 的建模负担、让它的训练行为更难控制。

有些 latent 探测结果甚至会误导人:某个表示在训练早期看着收敛很快,如果信号配比不合适,反而会更早触顶。所以我们是通过 VAE 在完整生成训练里的表现来评估它,而不是只看重建或孤立的探测指标。

推理部署还有啥优化方案

Q:H3 为什么难以运行在普通 GPU 上?目前在做哪些优化工作?

MiniMax:H3 开放系统的部分约有 600 亿参数,包括 text encoder 和 DiT model。BF16 权重约需要 120 GB 内存,而多数消费级 GPU 只有 24 GB 或更少。

我们正在做的主要优化工作包括 quantization(量化) 和 offloading(卸载):前者用更低精度存储权重,减少内存占用和数据搬运;后者把当前计算所需的部分移动到 GPU,其余保留在系统内存中。我们还发现,社区里已经有了很多在量化、加载和推理加速方面的工作流分享,欢迎大家继续探索。

大家可以先确认使用最新版本的 ComfyUI、官方 H3 workflow 和正确的 low-memory models。模型无法全部留在 VRAM 时,速度变慢是正常现象。ComfyUI 会在需要时搬运权重,实际速度还取决于系统内存和 PCIe 带宽,offloading 设置也可以带来速度与质量之间的平衡。

Q:官方会不会推出低步数(4/8 步)的版本?

MiniMax:目前发布的版本已经包含了 CFG 蒸馏。我们在最终训练阶段还引入了一种特殊策略,使模型能够以更少的推理步数运行,但这并不等于一个专门针对极低步数机制蒸馏出来的模型。

我们正在持续探索进一步的分步蒸馏,目标是在不明显降低质量的前提下降低推理成本。考虑到社区对效率的强烈需求,我们也在积极评估步数更少的版本,比如 4-NFE 或 8-NFE 版本,但短期内无法承诺会发布。

回应高分辨率与生成质量质疑

Q:H3-Regenerate-2K 到底是怎么工作的?社区测试后感觉它像是把整个基础模型当成 Upscaler 又跑了一遍,官方能确认吗?未来会开放本地版本吗?

MiniMax:它是一个二次生成阶段,但并不是简单地把已发布的 Checkpoint 当成常规 upscaler 再跑一遍。这个阶段使用了一个专门面向更高目标分辨率的 latent-space DiT regeneration checkpoint,同时把基础模型的输出当作额外的上下文信息,并提供一些更高分辨率的参考输入。

我们计划开源这个模块,但目前还在提升它的效率和质量,让它更适合社区和本地使用。这项工作还在进行中,暂时没法给出确切的发布日期。

Q:为什么 Ref2VA(参考生成)的输出质量明显比 i2v(图生视频)差?

MiniMax:是的,我们注意到了这个问题。由于训练后处理策略不同,FL2VA 和 Ref2VA 这 checkpoint 目前在视觉质量上确实存在明显差异,我们正在积极提升 Ref2VA 的画质。一个实用技巧是尽量使用最高质量的参考输入,因为 Ref2VA 对参考信号的处理质量可能比较敏感。

Q:一个反复出现的问题是,画面里较小或较远的物体会像素化、发糊,即便 2K也一样。这是为什么?

MiniMax:我们也观察到了这个问题,这会是我们接下来重点改进的方向之一。现在根据内部实验,它不能简单归因于 Visual VAE 的高压缩比,也不能准确归因于任何单一训练阶段。这是一个复杂的系统级问题,牵涉到模型和训练流程中多个部分的交互。我们还在继续定位主要影响因素,会在未来的更新里改进。

Q:有没有可能用循环续接的方式,生成远超原生 15 秒窗口的长视频?H3 训练时接触过这种续接分布吗?

MiniMax:我们最初确实训练过一个用扩展 RoPE 位置的专门音视频续接任务,作为独立任务,它表现得非常好。但我们发现这种 RoPE 扩展方式在多任务环境下泛化能力较弱,也不太容易自然地融进通用的上下文生成框架里。

所以,发布的模型改成了通过标准的参考条件方式来学习续接,Ref2VA 会把前面的内容当作参考条件来支持延续。当前模型还没有针对「包含多段循环续接的长轨迹」做原生训练。要做到真正的循环续接,我们认为用稀疏注意力做原生长轨迹训练是一个很有前景的方向,它能显著降低这类训练的计算成本,也有助于减少循环窗口之间逐渐累积的质量和一致性下降。

未来的模型路线与开源计划

Q:你们之后是否会发布 Context-IR 的模板?还有哪些使用技巧?

MiniMax:我们发布过两份官方提示词指南,已经提供模板示例,也将这两份指南整合成了一个 GitHub Skill 并持续迭代。想获得最完整、原生的 Context-IR 体验,建议直接使用官方 API。

本地部署用户,T2V 是最容易上手的模式,因为只需要文本 prompt,H3 Context-IR API 则可以进一步增强用户的 prompt,帮助生成更好的视频。ComfyUI 用户可以从官方模板开始尝试构建,熟悉后再逐步加入参考图像、音频和镜头控制等功能。

Comfy 团队在直播中也给出了一些使用技巧。例如,输入音频参考时,如何让对白和画面更稳定?建议把输入音频作为 reference,同时在 prompt 中用引号写出角色需要说的对白,并放在对应镜头的描述中。这样通常能提升对白生成的稳定性和一致性。

而对于很多人提问的多镜头产品广告工作流,搭建的方法也并不复杂:可以用输入参数定义视频时长和镜头数量,例如 10 秒、5 个镜头,平均每个镜头约 2 秒;再通过 LLM prompt enhancer 生成预览 prompt,并传入多个参考画面。ComfyUI 模板库已经提供了相应的基础工作流,用户可以自行调整镜头、参考输入和提示词。

Q:能不能把 H3 用作图像生成/编辑,只出一帧,变成流式视频生成模型?

MiniMax:H3 不是流式视频生成模型,所以它没法先生成一个「预览帧」,再把同一次生成延续成视频。更合适的流程是先用一个图像模型生成第一帧,再用 H3 的 I2VA 模式生成视频。

Q:未来会不会基于H3推出图像模型?

MiniMax:会。我们计划开源一个统一的模型,同时用于文生图和通用图像编辑。它与 H3 共享相同的底层架构,我们目前正在完善和优化它的后训练阶段。

也就是说,我们正在从 H3 模型谱系推导出一个专用的图像模型,希望提供给社区。它会复用和 H3 相同的 VAE 编码器:这个图像模型会沿用 H3 的 VAE Encoder 架构。由于 H3 的 Temporal Encoder 是 Causal 的,团队可以通过 Weight Slicing 获得一个二维 VAE Encoder。但同时,我们还计划为图像生成模型提供一个专门设计的 VAE 解码器。

Q:MiniMax 在未来还会继续开源吗?对语音、音乐模型有没有后续的开源计划?如何确定优先级?

MiniMax:在 H3 发布后很短的时间里,开发社区已经有了不同量化版本、ComfyUI 适配和 MLX 等硬件支持。对 MiniMax 来说,这种快速迭代和探索,正是开放协作能够带来的价值。

我们的愿景是 Intelligence with Everyone,推动这一领域的发展是我们的核心使命之一。我们会持续认真思考,如何作出最有意义的贡献,同时密切关注社区反馈,并在共同前进的过程中保持开放。

对于后续模型,我们当前的优先级仍然是,在实际可用、资源可接受的前提下持续提供更强的能力。

H3开源后,社区和创作者已玩嗨

看完 H3 的这次 AMA,我有一种很清晰的感觉:MiniMax 对开源这件事,有着自己的节奏。

虽然这次 H3 系统的三个模块并未完全开放,但从交流里能看出,团队一直在摸索更适合社区使用的版本,对社区需要的 infra 支持也有长期规划

而 H3 目前的开源进度,已经足以让全球开发者和创作者玩起来了。各种创意工作流、教程和新玩法不断涌现。

比如模型一出来,ComfyUI 社区就实测出了运行 H3 的最低配置。


也有博主发布了低显存玩家使用 H3 的详细教程。


围绕 H3 的提示词教程和创作案例,更是铺天盖地。


MiniMax 官方也亲自下场,整理了更多玩法和教程:https://hailuoai.com/h3-open。

这些都说明,H3 的这次开源,真实地让大伙把视频模型玩出了花。

在官方、开发者和创作者的共同努力下,顶尖视频模型与普通人之间的距离,正在一点点缩短。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
货拉拉司机加价不成带着货跑到600多公里外,平台介入交涉仍拒交货

货拉拉司机加价不成带着货跑到600多公里外,平台介入交涉仍拒交货

新闻晨报随申Hi
2026-08-11 18:52:19
为啥说幼师是知道秘密最多的职业?网友:所以从来不敢让孩子看见,太社死了

为啥说幼师是知道秘密最多的职业?网友:所以从来不敢让孩子看见,太社死了

带你感受人间冷暖
2026-08-12 00:05:13
乌克兰跨境攻入俄罗斯领土库尔斯克!消灭俄军装甲纵队

乌克兰跨境攻入俄罗斯领土库尔斯克!消灭俄军装甲纵队

项鹏飞
2026-08-11 20:13:04
卢本伟和巴旦木公主官宣结婚,好友PDD送了一辆库里南

卢本伟和巴旦木公主官宣结婚,好友PDD送了一辆库里南

映射生活的身影
2026-08-11 15:49:22
被烧了164年的圆明园,地下忽然传出动静,专家:我们被骗惨了

被烧了164年的圆明园,地下忽然传出动静,专家:我们被骗惨了

道远文史
2026-08-12 06:59:17
大事不妙!支持率跌至35%,萨德导弹见底80%,特朗普的中东账本兜不住了!

大事不妙!支持率跌至35%,萨德导弹见底80%,特朗普的中东账本兜不住了!

News脑洞
2026-08-10 18:40:50
俄罗斯“截机”事件后续

俄罗斯“截机”事件后续

战争研究所
2026-08-12 01:07:16
财经大V:80%的男人一个月赚不到7000元,如果你税后7000元,不管男女,你可能已经胜过90%的人,评论区一片认同

财经大V:80%的男人一个月赚不到7000元,如果你税后7000元,不管男女,你可能已经胜过90%的人,评论区一片认同

谭谈社会
2026-08-11 20:56:50
著名钢琴家、钢琴教育家李民铎逝世

著名钢琴家、钢琴教育家李民铎逝世

澎湃新闻
2026-08-11 22:24:26
赵一鸣4块牛肉干64元,复称仅17元。老板说“系统问题”,顾客说“每样都多称了”

赵一鸣4块牛肉干64元,复称仅17元。老板说“系统问题”,顾客说“每样都多称了”

听心堂
2026-08-11 21:39:10
12日凌晨WTT大满贯:3-0!早田剃光头,无奈的是,她又要打蒯曼了

12日凌晨WTT大满贯:3-0!早田剃光头,无奈的是,她又要打蒯曼了

天光破云来
2026-08-12 07:04:00
胖东来把全国房东都干懵了!

胖东来把全国房东都干懵了!

贩财局
2026-08-11 16:28:26
申花敲定新主帅!米洛耶维奇抵达上海,6天后京沪大战或迎首秀

申花敲定新主帅!米洛耶维奇抵达上海,6天后京沪大战或迎首秀

奥拜尔
2026-08-12 09:07:37
高考444分考生回应被殡葬专业录取:出生于4月4日,当天还是清明节,纯属巧合,自己高一时就开始关注殡葬行业,就业前景不错

高考444分考生回应被殡葬专业录取:出生于4月4日,当天还是清明节,纯属巧合,自己高一时就开始关注殡葬行业,就业前景不错

极目新闻
2026-08-11 20:23:20
程梦圆灵车下山全程车窗敞开,内情远比流言更戳心!

程梦圆灵车下山全程车窗敞开,内情远比流言更戳心!

据说说娱乐
2026-08-12 04:29:43
接受《时代》专访,郑丽文:避免台海走向一场没人承受得起的战争

接受《时代》专访,郑丽文:避免台海走向一场没人承受得起的战争

海峡导报社
2026-08-12 10:15:16
美向伊朗索赔引哗然!伊媒:荒谬无理;美媒:谈判策略

美向伊朗索赔引哗然!伊媒:荒谬无理;美媒:谈判策略

环球时报国际
2026-08-12 09:28:24
中央气象台8月12日06时继续发布暴雨橙色预警

中央气象台8月12日06时继续发布暴雨橙色预警

环球网资讯
2026-08-12 07:32:07
有一种卑微:在弱者身上挑毛病,在权力里只找亮点

有一种卑微:在弱者身上挑毛病,在权力里只找亮点

吴女士
2026-08-11 17:24:16
俄罗斯终于露出了最致命的软肋!战死在乌克兰的,大多是布里亚特

俄罗斯终于露出了最致命的软肋!战死在乌克兰的,大多是布里亚特

果妈聊娱乐
2026-08-12 08:32:47
2026-08-12 12:20:49
四木相对论 incentive-icons
四木相对论
唠唠科技,看看世界
176文章数 3关注度
往期回顾 全部

数码要闻

SK海力士计划2027年将中国工厂的NAND闪存产量提升50%

头条要闻

灵异探险博主"姜小柔"车祸去世年仅24岁 家属发布说明

头条要闻

灵异探险博主"姜小柔"车祸去世年仅24岁 家属发布说明

体育要闻

NBA老顽童,抽着大麻喝着小酒告别了

娱乐要闻

陈思诚恋情疑云再起

财经要闻

李嘉诚,再一次大撤退!他嗅到了什么?

科技要闻

Claude又出骚操作 改个错字也要留AI水印?

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

旅游
艺术
本地
家居
公开课

旅游要闻

看演出、住主题客房、品下午茶,来上海赴一场沉浸式戏旅之约

艺术要闻

色彩的盛宴,视觉的狂欢:西班牙水彩大师福斯蒂诺·马丁·冈萨雷斯的艺术世界

本地新闻

黄州一夜,苏轼写给普通人的月光

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版