![]()
第一次,效果对标 Seedance 2.0 的视频旗舰模型交到了所有人手里。
作者丨吴海明
编辑丨李 娜 马晓宁
今天,MiniMax 发布了视频旗舰模型 H3。在模型效果得到一众创作者认可之余,引人注意的是价格:H3 的价格仅为 Seedance 2.0 的三分之一。
更关键的是:即将开源了。这是第一个做到这个水平的开源视频模型。接下来的事,可能会改变整个行业的游戏规则。
当一个旗舰能力的视频模型开始开放,视频生成会不会复制 Stable Diffusion 曾经在图像生成领域掀起的生态扩散?而 MiniMax,又能否借此在视频生成赛道中,走出一条不同的路?
下面,我们从模型能力、行业位置和开源意义三个层面,拆解 H3 为什么值得关注。
![]()
01
AA 榜单: MiniMax H3 反超 Omni、Seedance
H3 的重点不仅是视频模型,而且是通用多模态。H3 把文本、图片、音频、视频等素材纳入同一个上下文,由模型统一理解创作意图,并在此基础上完成从脚本理解、分镜生成、角色与场景保持、动作迁移、音画同步,到字幕、品牌文字、转场包装和局部编辑等一系列任务,最终一次性生成更接近商业成片的视频内容。
![]()
Artificial Analysis 最新榜单截图
在 Artificial Analysis 最新的视频编辑排行榜单中,MiniMax H3 以1130 Elo排名第一,领先 Google Gemini Omni、字节 Seedance 2.0等模型。
榜单排名证明了 H3 的效果水平,但真正决定其商业价值的是它能否进入真实的商业应用场景。相比单纯生成画面,H3 更强调编辑、文字、声音和素材参考的一体化能力。经过实测,其差异化能力可以体现在下面三个方面:
1.全模态精准编辑。H3 支持在已有视频上进行换人、换物、换背景、绿幕合成、改台词、调光影和视频续写等操作。
2.复杂文本的保持与视觉融合。视频中的文字需要在连续帧中保持稳定,不能变形或漂移。H3 在电影片头字幕、产品 UI 文字、动态海报排版等场景中极具优势。
3.一站式成片。H3 将画面生成、声音生成、文字呈现和镜头节奏整合在同一模型中,让用户无需依赖额外后期处理流程即可获得交付所需的完整视频片段。
Prompt:两位魔术师站在舞台上面向观众表演互换魔术:两人同时挥动魔杖,一阵烟雾升起。烟雾散去后,两人的西装颜色互换——左边的人穿白色西装,右边的人现在穿黑色西装,但两人手套颜色不变。两人鞠躬致谢,身后的红色幕布拉上,从深红色渐变为深蓝色。H3(上)抽卡成功率非常高,Seedance(下)略逊一筹。
此外,H3 的价格仅为 Seedance 2.0 的 1/3,H3 的竞争力并不只体现在模型效果上,也体现在性价比上。对于需要高频生成和快速迭代的商业场景而言,其商业化吸引力有望进一步放大。
整体来看,H3 的看点是 MiniMax 试图把视频生成、音频生成、素材参考和视频编辑等特定任务统一到一个模型框架中。
![]()
02
H3 如何统一多个模态的
创作链路,还能保持模型泛化?
根据 MiniMax 官方公众号分享,H3 的技术目标是实现任务的统一和泛化。
多模态模型面临多种能力要求:图像生成中有文生图、图像编辑、主体参考等任务;声音生成中有人声、音效、音乐等不同模型;视频生成则进一步细分为文生视频、图生视频、视频编辑、动作参考等能力。
![]()
H3 生成的技术路线图
与现有多模态生成模型由多个专家模型组成不同,H3 以语言作为泛化的桥梁,将这些能力纳入同一个预训练范式:文生视频可以同时生成画面和音频,声音不再区分人声、音效和音乐,参考与编辑关系也通过自然语言描述,不用依赖固定功能入口,并构建四项核心技术:
1.Contextual Omni Representation:增强多模态 Caption 能力,使模型在描述目标视频的同时,还能理解素材之间、素材与目标视频之间,以及画面与声音之间的关系。
2.H3-VAE:升级视频 tokenizer,在重建质量和压缩效率上提升。官方称其带来 4 倍序列长度收益,是 H3 支持原生 2K 输出的关键。
3.H3-Omni Transformer:采用理解与生成异构的训练架构,并通过样本间负载均衡,将端到端训练吞吐提升近 30%。
4.In-context Regeneration:与传统专用超分模块不同,H3 让基模基于低分辨率结果和上下文信息重新生成 2K 细节,以提升小文字、纹理和画面细节的还原能力。
![]()
03
H3 卡在了行业的什么位置?
要理解 H3 的位置,得先回顾一下视觉内容生产工具这些年的演进历程。过去十多年,视觉生产经历了从专业软件、AI 辅助工具、图像生成模型,再到视频生成模型的连续跃迁。H3 所处的节点,正是视频模型从素材生成走向商业级成片级交付的关键阶段。
在生成式 AI 出现之前,视觉内容生产主要依赖专业软件完成。修图靠 Photoshop,动效包装靠 After Effects,剪辑靠 Premiere,调色靠 DaVinci Resolve,导致一条十几秒的广告短片,往往需要设计、剪辑、后期、动画师等多个角色协同完成。在这一时期,虽然专业软件提供了足够强的创作能力,但也抬高了内容生产的技术门槛和协作成本,导致视频的制作成本极其昂贵。
紧接着,在 2016 年前后 AI 开始以辅助工具的形态进入这条生产流水线。自动抠图、智能修图、视频补帧、内容识别填充等功能逐渐普及,帮助创作者减少重复劳动。但在这一阶段,AI 工具更多是嵌入既有软件体系中的效率插件,承担辅助工作。
2021 到 2023 年,Midjourney、Stable Diffusion让AI内容生成成为现实,其中 Stable Diffusion 的开源尤其关键,围绕开源模型催生出了LoRA、ControlNet、ComfyUI等完整生态,形成了“开发者做插件,创作者搭工作流,企业训行业模型,云厂商做推理优化”的新型产业格局。由此证明了一件事:一个足够强的开源模型,往往会成为整个生态的底座。
早期视频模型只能生成几秒钟片段,人物容易变形,物体边界闪烁,动作连续性差,更像会动的图片。2023 年下半年之后,Runway、Pika、可灵、海螺、Vidu 等产品把 AI 视频从几秒 Demo推向可用素材:分辨率提升,时长变长,运动稳定性也更好。越来越多的社媒短片、电商素材、广告创意开始真正使用 AI 生成内容。
但这一阶段的大部分视频模型仍然停留在素材级。创作者可以用模型生成一段画面,但要变成能交付的广告、短剧片头、游戏预告或产品视频,还需要回到剪映、Premiere、After Effects 里做剪辑、包装、字幕、调色、合成和音效。这也是为什么 2024 年之后,视频模型的竞争标准发生了变化,行业开始看谁更接近真实生产流程。
OpenAI 的 Sora 曾经被视为视频生成赛道正式进入加速期的标志性事件,Google Veo 系列继续以高画质、原生音频和复杂场景生成维持质量标杆,字节 Seedance 则把视频模型推向更高可用性,尤其在镜头一致性、动作表现和商业素材生成上获得大量关注。一些创作者已经开始用 Seedance 替代部分实拍环节,尤其是在广告创意预演、短片概念片、电商展示和社交媒体素材中。已经开始替代一部分为了验证创意而拍的低成本实拍需求。
过去线性的视频生产流程正在被 AI 模型压缩:从素材生成、剪辑包装到调色配音,越来越多原本需要后期完成的执行环节,开始被模型直接吸收进生成过程。创作者仍负责节奏、审美和商业判断,但单位内容的生产成本、交付周期和试错速度正在被改写,而 H3 正是卡在这一转折点上。
H3 的设计明显是冲着真实生产场景去的,是冲着商业级成片交付去的。
这些任务考验的更多是商业视频生产中最核心的几件事:文字能不能保持稳定,品牌信息能不能准确出现,镜头之间有没有节奏,声音和画面能不能同步,包装是不是像一个完整交付物,而不是一段孤立素材。
比如,H3 把一部分后期包装能力前置到模型内部,实现了AI原生后期。
在海外开发者 @hasantoxr 的测试中,H3 可以给实拍视频增加手绘发光动画,通过自然语言描述即可指挥动画路线,可以并匹配场景光线同时保留真实光影关系。过去,这类工作通常属于 Adobe AE 和人工后期的领地;视频模型更多只是提供原始素材,再由创作者拿回后期软件精修。
如果 H3 的这些能力能够在真实工作流中稳定复现,那 H3 代表的将多模态模型发展历程上的一次新的突破:从生成素材,进一步走向理解内容、执行包装、完成编辑和接近交付。这也是 H3 在行业中的真正位置:它处在视频模型从文娱工具转向工业生产力工具的拐点上。过去 AI 视频的主要价值是能不能生成,现在工业界真正关心的是能不能交付,H3 要回答的,正是后一个问题。
![]()
04
开放最新视频旗舰,H3想改变什么?
如果说 H3 的商业级成片交付能力是“本分”,那么开源才是它真正试图撬动行业格局的地方:MiniMax 不仅是把一款视频旗舰模型推向市场,还把它交给开发者、企业和创作工具链共同改造。
在大模型行业,开源并不罕见,但在视频生成领域,真正具备头部能力的模型开放权重,仍是少数事件。原因在于,视频模型的训练成本、推理成本、数据组织和工程复杂度都远高于文本与图像模型,越接近旗舰能力,模型厂商越倾向于用闭源产品和 API 回收成本。
此前,视频生成的开源阵营中,阿里万相、腾讯混元视频、LTX 等模型较为活跃,但与 Seedance 这样的闭源旗舰相比,行业普遍认为仍存在能力差距。H3 的特殊之处不仅在于效果比肩 Seedance 2.0 和价格只有 Seedance 2.0 的 1/3,而且它是第一个业内旗舰级别的开源多模态模型。
H3 发布后,开源消息迅速在开发者社区传播,这种反应也在一定程度上说明了:市场长期缺少一个足够强、可部署、可定制的视频模型底座。
▎企业侧:获得部署、数据与工作流的控制权
H3 首先补上的是企业级部署的缺口,对大公司来说,数据本身就是护城河。广告、影视、游戏、电商等行业的视频生产,往往涉及未公开产品、品牌资产、用户画像、人物形象、商业脚本和内部创意方案。这些内容一旦上传到第三方闭源模型,就意味着企业要承担数据外流、知识产权归属不清和商业机密泄露的风险。
这种顾虑并非空穴来风。此前,三星曾因员工将敏感代码上传至 ChatGPT 而限制内部使用生成式 AI 工具;摩根大通也曾限制员工使用 ChatGPT,原因之一正是数据隐私和合规风险。这说明,企业不敢轻易让核心数据进入外部黑箱,闭源 API 虽然方便,但企业无法完全掌握数据是否被留存、是否进入训练集,以及生成内容背后的权利边界。
H3 开源后,企业可以选择私有化部署,把模型放在自己的服务器或私有云中运行。电商平台的商品库、游戏公司的角色资产、短剧公司的演员形象和场景素材,都可以留在企业内部系统中完成调用。相比完全依赖第三方 API,这不仅有助于降低高频生产下的边际成本,更重要的是让数据安全、知识产权和生产流程重新变得可控。
▎生态侧:H3能否成为视频领域的开放底座?
私有部署只是第一层价值,对行业而言,H3 开源更大的意义是让视频模型具备被定制和扩展的可能。
视频生产本身并非标准化场景。电商关注商品准确性和转化效率,游戏关注角色一致性和动作风格,影视短剧关注人物连续性和情绪节奏,广告则强调品牌规范和视觉调性。闭源模型再强,也很难用一个统一入口覆盖所有细分需求。
开源后,企业和开发者可以基于 H3 微调、适配和二次开发,训练更懂商品、角色、品牌资产或镜头语言的行业版本,也可以将其嵌入剪辑工具和创作平台,形成从素材生成、镜头续写、声音合成到包装交付的一体化工作流。
图像生成领域已经证明,强开源底座往往会催生插件、微调模型、工作流模板和行业应用。若视频领域也出现类似底座,围绕 H3 的推理优化、风格模型、行业插件和创作工具链也可能随之形成。
因此,H3 开源不仅是让企业放心使用,更是视频模型从一家公司的封闭产品,变成可以被企业部署、被行业微调、被开发者扩展的开放基础设施。视频模型的竞争也会从单纯比较画质和价格,转向比较谁能形成更强的生态密度、定制能力和产业渗透率。因此,H3 开源释放了一个明确信号:视频生成的竞争,正在从闭源旗舰之间的单点能力比拼,进入开放生态和产业落地能力的综合竞争。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.