做过信息流广告的人,大概都经历过这种崩溃。
一条AI视频已经生成得很好:人物没有变形、动作基本连贯、光影和节奏也符合要求,偏偏产品包装上的Logo在某一帧突然闪烁,或者卖点文字短暂变成乱码。
如果只是拿来展示模型能力,这点错误很容易被忽略。但在真实投放中,品牌名称、产品包装和价格信息错一帧,整条素材都可能无法交付。
更麻烦的是,过去的AI视频工具很难只修改出错的局部。创作者通常只能重新生成整段视频,再赌一次人物、构图和文字能否同时正确。
所以商业视频不是一道按比例给分的考试。
一条素材即使有90%的内容正确,只要剩下10%涉及品牌和产品,它的交付价值仍然可能是零。
这也暴露了过去两年AI视频行业最真实的问题:演示效果越来越惊艳,进入生产线之后的可用率却不一定同步提升。
判断一个生成模型是否成熟,不能只看官方展示了什么,更要看它有没有真正进入企业的成本表。
H3开始回答“能不能交付”这个问题
7月31日,MiniMax正式发布视频旗舰模型H3,并宣布计划在未来几天内开放模型权重。
从已经出现的测试结果看,H3被放进了与Seedance等头部视频模型相近的比较区间。它不仅强调2K画质和音视频联合生成,也把主要精力放在多模态理解、局部编辑、文字呈现、多轮一致性以及生成成本上。
这些能力组合在一起,指向的已经不是“生成一段好看的视频”,而是另一个更现实的问题:
企业能不能用它稳定地完成工作?
根据官方定价信息,H3在2K分辨率下的每秒价格不到Seedance的三分之一。低价本身不是终点,但当模型效果接近、成本明显下降时,企业采用AI视频的计算方式就可能发生变化。
买单的人变了,评价标准也变了
据头豹研究院相关测算,2025年全球AI视频生成市场规模约为86.8亿美元,预计到2030年增长至519.3亿美元。其中,B端客户贡献约65%至70%的市场份额,营销广告与影视娱乐占据七成以上营收。
国内市场也处于快速扩张阶段。相关预测显示,中国AI视频生成市场规模可能从2025年的约12.1亿元,增长至2030年的1497亿元;广告行业的AI视频采用率已达到56%。
不同机构对市场规模的统计口径可能存在差异,但这些数据共同指向一个趋势:AI视频的主要付费者,正在从尝鲜的个人用户转向重视投入产出的企业客户。
个人用户可能会为一次惊艳效果买单,企业却要计算更多问题:
- 一条合格素材最终需要花多少钱?
- 第一次生成的可用率有多高?
- 出现错误后能否局部修改?
- 完成交付需要多少人工介入?
- 能否接入已有内容生产流程?
- 批量生成时,人物和品牌信息是否稳定?
当企业成为主要付费者,画质就不再是唯一指标。
模型真正的成本,也不只是页面上显示的每秒价格,而是:
单次生成价格 × 平均尝试次数+后期修改时间+人工审核成本。
一条中文广告,能不能直接改成英文版?
短剧出海、跨境广告和品牌全球化内容,都需要批量制作不同语言版本。
传统做法是重新寻找演员和配音人员,再处理字幕、口型、产品包装和本地化表达。一条素材从中文版变成英文版或日文版,通常要经过多个岗位,制作成本可能达到数千元。
如果AI能够在保留原人物、动作、商品和场景的情况下,直接替换语言、口型与字幕,商业价值就不只是“节省一次拍摄”,而是能够反复复用已有素材。
在一组针对H3的测试中,输入内容包括:
- 一条现成的中文口播视频;
- 一张原视频中从未出现过的新产品图。
任务被拆成多个步骤:
- 将原视频中的商品替换成新的气泡水产品;
- 把中文口播改为英文;
- 增加对应的英文字幕;
- 保持人物身份、动作、背景和镜头基本不变。
![]()
![]()
![]()
从结果看,H3表现较好的地方主要有四点。
首先,多轮修改后,人物身份、动作和整体背景没有出现明显漂移。
其次,新产品包装更接近被直接放入原视频,而不是根据描述重新绘制。“LIME ZERO”“0糖”等包装文字在修改过程中基本保持清晰,没有被重新生成成错误字符。
第三,英文声音延续了原人物的大致年龄感和语气,没有出现明显的角色割裂。
第四,字幕能够按照语义自动分段,并主动避开人物面部和商品主体,说明模型不只是生成字幕,也在判断画面中的视觉重点。
但这组结果仍然没有达到完全自动交付的程度。
人物口型只能覆盖大部分英文发音变化,部分音节仍然不够准确;英文口播的情绪层次也比原视频稍弱。正式用于广告投放前,仍然需要人工检查口型、字幕、包装文字和表达是否符合当地语境。
它距离专业影视级的逐音素配音还有差距,但对于强调高频生产和快速迭代的信息流素材,已经开始跨过“能够实际使用”的门槛。
H3替企业省下的,不只是一笔生成费
把H3放进真实的内容生产流程中看,它主要对应四类成本。
第一类:拍摄与分镜成本
广告和影视素材所说的“电影感”,并不只是一个审美形容词。
它背后包括镜头运动、空间关系、光影层次、动作衔接和节奏控制等具体要求。过去要实现这些效果,需要提前制作分镜、布置灯光、安排演员,再通过摄影和后期完成。
在“凌晨进入便利店购买气泡水,随后走入雨中”的15秒案例中,H3通过跟拍、中景和产品特写完成镜头推进,便利店冷光、雨夜反射和人物动作也保持了相对统一的空间关系。
![]()
它不能完全替代专业拍摄,但可以显著降低概念片、提案样片和部分信息流广告的制作门槛。
第二类:工具切换成本
传统AI视频流程往往需要多个工具接力:
一个工具生成人物,一个工具处理产品图,一个工具让画面动起来,再分别处理声音、口型、字幕和剪辑。
H3支持将图片、文字、音频和视频等多种素材放进同一个上下文中,最多可以混合输入12个文件。
模特、商品、品牌风格、参考动作和声音可以一次性提供给模型,再通过自然语言说明每一份素材的用途。
减少工具切换,不仅节省操作时间,也能降低素材在多次导出、转换和重新生成过程中出现偏差的概率。
第三类:品牌信息出错成本
对普通创意视频来说,文字偶尔出错可能只是瑕疵;对商业广告来说,品牌名、产品型号、价格和核心卖点出错,可能直接导致素材报废。
在海报、产品包装和舞台屏幕等测试中,H3对小文字、透视关系和环境亮度的处理有所提升,也减少了明显的错字和闪烁。
真正有价值的并不是模型“会写字”,而是文字能够跟随物体运动,并自然地存在于光线和空间中。
第四类:返工与漂移成本
生成式视频最昂贵的问题,往往不是第一次生成,而是修改。
如果用户只想更换一个产品,模型却同时改变人物长相、背景和镜头,意味着此前确认的内容全部需要重新审核。
在产品替换、背景调整和口型修改等测试中,H3表现出了较好的多轮稳定性。修改局部内容时,已经确认的人物、动作和环境没有被大面积重做。
这类能力看起来不如2K画质吸睛,却是生成模型接入商业工作流的关键底线:修改一处,就尽量只影响一处。
低价背后,是模型开始主动控制计算成本
H3在2K分辨率下的定价不到Seedance的三分之一。这个价格并不完全来自市场补贴,也与模型内部的工程优化有关。
H3-VAE提升了视觉信息的压缩效率,官方称其带来了约4倍的序列长度收益,从而降低训练和推理需要处理的数据量。
H3采用理解与生成异构的训练架构,针对不同任务调配计算资源,端到端训练吞吐提升接近30%。
在2K输出环节,H3也没有使用独立的传统超分模型,而是通过In-context Regeneration,让基础模型重新读取原始提示词和参考素材,对低分辨率结果进行高分辨率再生成。
传统超分主要根据低清画面猜测缺失细节,而上下文重构还能利用原始产品图、文字和其他参考信息,因此更有机会恢复商品包装与小字。
值得注意的是,MiniMax为了任务泛化,放弃了曾经帮助Hailuo 02提高效率的部分架构设计。
这个选择反映出一种长期判断:未来的视频模型不会一直停留在单一的文生视频或图生视频任务中,而会逐渐统一图片、视频、声音、参考和编辑。
模型架构必须为更广泛的任务服务,而不是只把某一个能力做到极致。
便宜的意义,是让更多场景变得算得过账
AI视频成本下降的意义,不只是同一条视频省了多少钱。
当生成价格进入每秒几毛钱的区间,信息流广告、电商素材、短剧和漫剧等高频内容开始具备批量采用的条件。
如果未来继续下降到每秒几分钱,同时保持足够高的生成成功率,市场可能进一步出现实时生成、千人千面广告和个性化视频等新形态。
当然,低价不代表一定便宜。
如果模型单次价格只有竞争对手的三分之一,却需要反复生成四次才能得到合格结果,那么最终成本优势就会被抵消。
H3能否真正改变成本曲线,还要观察三个指标:
- 首次生成可用率;
- 局部修改成功率;
- 批量生产时的一致性。
开放权重,可能比降价影响更深
MiniMax宣布将在发布后的数日内开放H3模型权重,目前pixpix官网(https://www.pixpix.com/)将首发接入,视频生成和编辑都支持。
![]()
如果开放的是具备主要能力的模型权重,并配套可用的推理代码、许可证和部署文档,它会给企业带来三类新选择。
第一,企业可以考虑私有化部署,减少核心素材、未公开产品和用户数据上传至第三方平台的风险。
第二,品牌、影视公司和游戏团队可以使用自身的IP、人物和视觉资产进行微调,建立专属模型,而不是每次依赖公共模型重新抽卡。
第三,云厂商、芯片公司和开发者可以共同优化推理框架、国产芯片适配和低显存部署方案,降低整个生态的使用成本。
但开放权重不等于完全开源,也不代表普通电脑可以直接运行。
真正决定开放价值的,还包括:
- 是否允许商业使用;
- 是否开放完整版本;
- 推理代码是否齐全;
- 部署需要多少显存;
- 能否进行模型修改和再分发;
- 国产芯片适配是否成熟。
在许可证和技术文档正式公布之前,“首个旗舰级开源视频模型”仍然更适合作为期待,而不是已经得到确认的结论。
AI视频开始进入真正的生产阶段
从Sora第一次让大众看到AI视频的想象力,到今天的模型开始处理产品替换、多语言口播、字幕、声音、局部编辑和私有化部署,行业的竞争标准已经发生变化。
以前大家比较的是谁生成的视频最惊艳。
接下来企业比较的会是:
- 谁的合格素材成本最低;
- 谁能减少重复生成;
- 谁能保住产品与品牌信息;
- 谁最容易接入现有工作流;
- 谁能让企业掌握自己的模型和数据。
H3仍然不完美,口型、情绪和部分精细画面依旧需要人工审核。但它所代表的变化很明确:AI视频正在从展示模型能力的Demo,进入可以计算成本、修改结果和评估回报的生产阶段。
当企业能够预测预算、控制返工并拥有部署选择时,AI视频才真正开始成为生产工具。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.