![]()
最近的 AI 圈真是热闹,字节跳动和 MiniMax 同天发布重磅新品:Seedance 2.5 和 MiniMax H3。
![]()
多少有点像国产 AI 厂商约好了:“7 月最后一天,大家一起交作业了。”
但这作业真不是随便糊弄的。视频生成和多模态这条赛道,直接被拉进了 Next Level。
先来扒字节这头的 Seedance 2.5。
官方给的 title 是"新一代视频创作模型",但字节这次的野心,明显不是只想让你拿它做几个发朋友圈的炫技小视频。
从放出来的东西看,Seedance 2.5 已经开始朝专业战场摸过去了:宣传片、影视级镜头、教育科普,甚至那种正经企业级的视频工作流,它都想掺一脚。
![]()
最直观的升级,单次生成从 15 秒翻倍到了 30 秒。
别觉得 30 秒很短,在 AI 视频的世界里,多一秒都是另一个维度的事。15 秒你只能展示一个动作、一个场景,说白了就是个动图 Plus。
但 30 秒,足够模型去组织一个有头有尾的小故事了:铺垫、推进、变化、收尾,麻雀虽小五脏俱全。
![]()
官方展示的那个案例你们感受一下:歌手坐在化妆间里化妆、起身穿过灯光昏黄的后台通道、跟侧幕的舞伴们用眼神对了个节奏互相拍了拍肩膀,然后聚光灯打下来,她大步迈上舞台,舞伴从两侧汇入,走位、转身、对视,一气呵成。
完整 30 秒一镜到底,不带断的。这哪是生成视频啊,这分明是让 AI 拍了个 MV。
而且如果 30 秒还不够你发挥,Seedance 2.5 支持 多轮延长 。你可以基于已经生成的视频往后继续长,模型会尽量咬着人物、场景和整体风格不放。这对长剧情、广告片、影视预告这种场景,简直救命。
说到这里,必须聊聊 AI 视频圈那个老生常谈的痛:"抽卡"。
用过 AI 视频的狐友们应该都懂那种想砸电脑的感觉:单看每一个镜头都惊为天人,一剪辑到一起立马现原形。
人物发型、衣服颜色、五官细节,跟你玩变脸似的,随机切换。
![]()
为啥会这样?因为过去的 AI 视频模型本质上是把每个镜头当独立任务处理的。它脑子里没有"上一个镜头长啥样"这个存档,每次生成都是闭眼重新抽卡,概率采样。
别看那些 AI 大神做的短片好震撼,其实背后全是血泪史:一个镜头生成几十次甚至上百次,跟淘金似的,只为了从一堆废料里扒拉出一个能用的。
B 站那部封神的 AI 短片《牌子》应该有人看过吧?7 分钟的片子,据创作者透露,单个镜头最高生成了 3000 次,纯纯大力出奇迹。
![]()
也正因如此,Seedance 2.5 这次死磕的方向正是"时序一致性"。让同一个角色在 30 秒内,跨多个镜头,穿同一件衣服,长同一张脸。
另外官方还提了个特别有共鸣的词: "油腻感" 。
懂的都懂,AI 视频那种通用毛病:人物皮肤跟统一批发了三斤高光似的,滤镜拉到失真,整个画面透着一股" AI 网剧"的廉价味儿。
![]()
Seedance 2.5 这次在画质、音质、运动自然度上都做了优化,同时把多模态参考能力拉满了。单次输入最多能塞 30 张图片、10 段视频和 10 段音频进去当参考素材。
模型不光能认出素材里是谁,还能理解构图、场景风格、人物关系和声音特征,然后按你的要求重新组合。
特别是在多人场景里,它能死死按住不同人物的外貌、动作和声音,不让它们瞎跑偏。
但Seedance 2.5真正让影视民工两眼放光的,是那套编辑与时间戳能力。
你可以像写分镜脚本一样用时间戳调教视频:规定" 0-5 秒推镜头,5-10 秒人物回头,10-15 秒爆炸",模型就老老实实按时间线执行。
还可以看哪段不顺眼,直接选中"片段重拍",像用 Photoshop 框选局部一样原地替换,其他地方原封不动。
更离谱的是绿幕编辑能力,你拍了一段人物在绿幕前的素材,想让背景换成火山喷发还是赛博都市,Seedance 2.5 直接抠掉绿幕把新场景塞进去。
关键是人物身上的飘带、衣褶的光影反射,会自动根据新场景的物理光照重新计算变动!
能力堆到这份上,字节当天甩出的合作名单也值得细品。
徐工、小鹏、智元、灵初、微分智飞、穹彻智能、Xspark AI......全是工业制造、汽车、机器人、智能驾驶的硬核玩家。
![]()
视频生成模型,正在跳出内容行业,一头扎进实体产业, 这信号太明显了。
以前企业要做个培训视频,要么搭景实拍,要么砸钱做 3D 动画,周期长、成本高,折腾半天还不一定能用。
现在呢?工业流程、设备操作、维修指导,AI直接给你生成,效率完全不在一个维度上。比如,徐工集团就已经在用 Seedance 生成工业操作培训和工序 SOP 视频了。
最绝的是自动驾驶,以前要采集暴雨、大雾、碰撞风险这些极限数据,测试车得在路上跑几个月。现在 AI 直接造个虚拟世界,要多少有多少。
聊完字节,再转头看 MiniMax 这边,完全是另一条路数。
如果说 Seedance 2.5 是在帮 AI 提升当导演的能力,那 MiniMax H3 的脑回路就是:别管什么导演不导演了,我直接给你搭一个全能制作系统。
![]()
官方给 H3 的定位是一款通用的全模态生成模型,支持对文本、图像、视频、声音的统一理解和生成,能直接输出带原生双声道的音视频,最高 15 秒、2K 分辨率。
但 H3 真正狠的地方不在于"能生成",而在于它把一堆原本分散的活全捏在了一起。
![]()
过去的视频模型通常各司其职:文生视频、图生视频、视频编辑、动作迁移……想做一个完整作品,经常需要多个模型接力。
H3的想法很粗暴:别拆了,全给我塞进一个模型里。
所以 H3 从一开始就把"任务的统一和泛化"当成第一纲领:人声、音效、音乐不分开建模,统一联合训练。
![]()
参考和编辑也不搞一堆专用接口,直接用自然语言描述你要啥,模型自己理解自己干。
举个官方给的例子你就明白了:你可以上传一段有特殊运镜的参考视频、一张人物图片、一段歌声,然后告诉它"参考视频 1 的希区柯克镜头运动,让图 2 中的人物唱歌,歌声参考音频 3"。
![]()
H3 会自动拆解你的指令,把镜头运动、人物形象、歌声特征全部提取出来,融合成一个全新的视频。你不需要知道它是怎么做到的,说人话就行了。
根据前期的邀测反馈,H3 在指令遵循、文字与品牌信息呈现、视频到视频动作迁移这些方面表现都很能打。
![]()
官方把它定位在广告、品牌、电商、产品设计、UI/UX、游戏这些商业场景,说白了就是给那些需要快速出片、反复改稿的打工人准备的。
![]()
在 Artificial Analysis 的全球视频编辑榜上,H3一发布直接登顶第一,把Gemini Omni都甩后面了。
![]()
价格也拉得挺低,2K 分辨率下每秒不到主流模型的三分之一,768P 下不到一半。这价不是靠补贴硬撑的,是架构优化硬抠出来的成本空间。
![]()
最狠的是,MiniMax 宣布 H3 开源,模型权重在魔搭社区正式发布。企业可以本地部署,拿自己的业务数据往上怼,随便优化。
两款模型,同一天发布,走的却是两条不同的路。
Seedance 2.5一头扎进实体产业,给工厂、车企、机器人公司当生产力工具;MiniMax H3直接开源,拉上所有开发者一起玩。一个往深了做,一个往宽了铺。
有网友锐评:旗鼓相当,但性格迥异。Seedance 2.5更懂导演想拍什么,H3更懂商业视频需要什么。一个像导演,一个像全能制作组。
赛道不同,终点一样:视频生成不能只停在“漂亮的片段”,必须走向“可用的结果”。
信息来源:火山引擎、MiniMax官网等等
编辑: 不吃麦芽糖
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.