QUOTE
Prompt 并没有消失,它正在变成模型内部的一种程序语言。
—— 平凡
MiniMax H3 这个工作对我来说最吸引的部分,就在于它的 Prompt 构造部分。
其实 Prompt 本身没有那么复杂。从 2023 年的 ChatGPT 到现在,大家都已经大概知道一个 Prompt 该怎么写了。
但文本大模型的 Prompt 和视频生成的 Prompt 还是不一样的,因为视频生成的 Prompt 大多数仍然需要手工构造大部分内容,毕竟你想让它严格表达自己的想法。
整个 H3 的系统架构图单看起来没有什么特别新奇的地方:内容理解(Context-IR)、视频生成(H3-Base),再到视频增强(Regenerate-2K)。但在 Content Understanding 这部分,我发现了一个非常有意思的地方。
本文看点
01
Prompt 如何变成程序
02
H3 统一了什么
03
多模态的下一步
01
INTERMEDIATE REPRESENTATION
Context-IR:从素材到可执行中间表示
![]()
这个部分叫 H3-Context-IR。IR 的意思是 Intermediate Representation,也就是“中间表示”。对程序员来说,这个概念很熟悉:我们在写 Python 或其他高级语言时,程序不会直接交给 CPU 或 GPU 运行,而是先转化成一种结构更明确、便于机器处理的中间形式。H3 做的事情也类似:自然语言、图片、视频和音频不会原封不动地直接交给视频生成模型,而是先经过 H3-Context-IR 理解和整理,再变成 H3-Base 更容易执行的内容。
下面是 MiniMax 给出的一个全模态 Rewrite 重构输出示例。
![]()
我把这个过程可视化以后,发现它其实非常直观。
![]()
以 MiniMax 给出的咖啡店案例为例,用户一共输入了4 张图片、2 段视频和 1 段音频。但 H3-Context-IR 没有把这 7 个文件原封不动地塞给生成模型,而是重新整理成 5 个需要持续追踪的参考对象。
场景
从第一张图片中抽象出咖啡店环境,包括砖墙、橙色沙发、霓虹灯和木质茶几。
动物主体
将第二至第四张图片共同归纳为同一只白色萨摩耶,通过多张图片补充它在不同角度下的外观特征。
女性角色
从第一段视频中提取年轻女性的外貌、发型和服装。
男性角色
从第二段视频中提取年轻男性的外貌和服装。
声音关系
把最后一段音频定义为女性角色的音色参考,但不直接复制原始音频中的话。
这一步最有意思的地方是,H3 没有把图片、视频和音频当成几个不可拆分的附件,而是把它们抽象成场景、人物、动作、音色等可以重新组合的属性。一个主体可以由多个素材共同定义,一个素材中的不同属性也可以被分配给不同任务。
完成这些定义以后,Context-IR 又为它们补充了一份保真约束:咖啡店、萨摩耶和两个人物的外观需要完整保留;音频则只参考女性的音色,不复制原始声音信号。
![]()
最后,它再把这些角色编排成三个镜头,明确人物什么时候进入画面、萨摩耶什么时候扑向饼干、谁在什么时候说话,以及镜头分别在第 3 秒和第 5 秒切换。
![]()
所以,这里真正发生的并不是简单的 Prompt 扩写。它更像是在做三件事。
「先建立一张素材和人物的符号表,再写下一份哪些内容不能改变的约束条款,最后生成一条按照时间执行的视听程序。」
对于习惯写代码的人来说,这套结构非常容易理解。它把原本混杂在一段自然语言里的要求,拆成实体定义、任务声明、保真约束和执行时间线。
这完全就是 AI 视频生成的“焚诀”:图片提供人物和场景,视频提供动作和机位,音频提供音色和节奏,Context-IR 负责把不同来源的能力重新组织到同一个目标视频里。
![]()
GIF 动图
如果按照 World Model 世界模型的逻辑来看,Context-IR 提供了视频理解,接下来的 H3-Base,也就是视频生成部分,则把理解出的核心内容重新生成。
理解和生成是一体两面的。能理解,才能生成。我觉得 H3 为未来视频生成领域提供了一种可能的 scaling law,因为它把视频生成变成了一个可以被形式化验证的过程。
02
RELATIONSHIPS
H3 真正统一的不是模态,而是关系
如果剪过视频,就会知道一个几分钟的视频可能包含几十段素材:图片、视频、音频、旁白、配乐、特效,以及需要另外用 AI 生成的镜头。素材很多,但数量并不是最麻烦的部分。
![]()
真正麻烦的,是素材之间的关系。
一段视频可能只用来参考动作,而不需要原来的场景;另一段视频只提供运镜;一段音频可能直接复用,也可能只参考音色;一张图片既要提供人物外貌,又可能要求其中的商品 Logo 不能发生变化。
传统视频生成工具通常要求用户先选择一个任务:图生视频、视频编辑、动作迁移、口型同步。
H3 则反过来,先判断每一项素材在最终结果中发挥什么作用,再由这些关系动态组合出当前任务。
官方指南也明确指出:输入中出现视频,并不自动代表视频编辑;如果视频只提供镜头运动、剪辑节奏或动作,它仍然属于参考生成。音频也可能是完整复制、部分复制,或者只参考音色、节奏和声音质感。
![]()
所以我认为,H3 真正试图统一的并不是文字、图片、视频和音频这几种模态,而是下面这个东西。
不同素材之间复杂而且可以自由组合的关系。
03
PROGRAM AND EXECUTION
Context-IR 是程序,H3-Base 才是执行机器
当然,Context-IR 写得足够详细,并不代表随便找一个视频模型都能把它执行出来。Context-IR 解决的是“用户究竟想要什么”;H3-Base 解决的则是“模型能不能真正做出来”。
人物是否变脸、动作是否自然、镜头能否准确执行、声音和嘴型能否同步,最终仍然取决于生成模型本身的能力。
H3-Base 使用 Qwen3-VL-32B 提取文字和视觉语义,图片和视频还会经过 VisualVAE,以保留人物、纹理、空间和运动细节,音频则由 AudioVAE 进行压缩。随后,这些内容被整理成一条统一的多模态序列,送入一个 33B 参数的单流 Transformer,同时生成视频和立体声音频。
![]()
这里有两个细节比较值得注意。
第一,图片和视频实际上会经过两条编码路径。Qwen3-VL-32B 负责理解画面“是什么”,比如人物、服装、场景和素材关系;VisualVAE 则负责保留它“具体长什么样”,包括人物外貌、颜色、纹理和连续动作。简单来说,一条负责语义理解,一条负责视觉保真。
第二,H3 没有先生成无声视频,再调用另一个模型配音。经过编码后的文字、图片、视频和音频,会被放进同一条多模态序列,再交给一个 33B 参数的单流 Transformer,同时生成视频和立体声音频。
这个设计与 Context-IR 是对应的。这也是我之前提到的,理解和生成永远都是一体两面的。
上层描述的是一个完整的视听事件:什么人在什么场景做什么动作,摄像机如何移动,谁在说话,声音从哪里出现。
底层也尽可能让画面和声音在同一个生成过程中共同形成,而不是先生成一段无声视频,再调用另一个模型进行后期配音。
所以 H3 真正带来的变化,不是视频生成的壁垒消失了,而是壁垒的位置发生了变化。
过去大家主要比较单个视频模型的画质;以后更重要的竞争,可能是系统能否理解复杂素材,生成可靠的中间表示,再让基础模型准确执行这些约束。
THE END
H1 → H3:AGI 的多模态拼图
如果把 MiniMax 过去几代视频模型放在一起看,这条路线其实很清楚。
1
Hailuo 01解决“视频能不能生成”。
2
Hailuo 02解决“视频能不能生成得更好、更便宜”。
3
H3开始解决“模型能不能理解一整套创作意图,并参与完整的视频生产过程”。
![]()
过去的 Prompt,本质上是一段人写给模型的说明书。生成失败以后,很难判断究竟是人没说清楚,还是模型没有执行好。H3 则把 Prompt 进一步拆成实体、来源、约束、镜头和时间线,让它变成一种可以自动生成、执行,甚至逐项检查的中间表示。
它创造了一个很重要的前提:过去依赖个人经验、很难标准化的视频 Prompt,开始变成可以结构化、批量生成和评价的数据。
当人物一致性、动作迁移、音色参考和镜头时间都能分别记录,系统就更容易判断问题发生在理解还是生成阶段,也更容易通过数据、模型规模和反馈提高复杂任务的成功率。
所以 Prompt 并没有消失,它正在变成模型内部的一种程序语言。人提供素材和意图,系统负责理解、编排、生成和修改。
H3 当然还不是完整的 World Model,更不是 AGI,但它已经呈现出一种多模态世界生成系统的雏形:先识别人物、场景和声音,再理解它们之间的关系,最后让这些关系在时间中发生。
从 Hailuo 01 到 H3,MiniMax 做的不只是让视频更清晰,也是在推动视频模型从一个负责生成画面的工具,逐渐变成参与内容生产的系统。
当人的意图能够被转化成可执行、可修改、可验证的视听世界,视频生成才真正开始成为一种创作基础设施。
最后,大家可以去 Hugging Face 上试一试 H3 这个模型,真的非常好玩:
https://huggingface.co/spaces/multimodalart/minimax-h3
我是平凡,关注 AI 与前沿科技。
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.