![]()
作者|黄小艺
微信 |H997Hbiu
7月31日,视频模型终于也有了自己的“撞车日”。
MiniMax H3 和字节 Seedance 2.5 在同一天上线。一个宣布即将开放权重,把文字、图片、视频和音频统一成一段可以自由调用的上下文;一个沿着闭源工业化路线,接替上一代 SOTA Seedance 2.0 的位置,用30秒直出、更大规模的素材参考和更精确的镜头控制,一次性生成长篇叙述。
它很像LLM竞争最热闹时才会出现的场面:两条路线,两个最能打的选手,正面撞进了同一个擂台。
所以我们也不绕了,直接让它们开打。
我们把同一组长 Prompt、参考图和参考视频分别喂给两款模型,安排了三轮同题 PK,再加两轮单项加试:既让它们拍电影、拍广告,也把它们推向多机位机器人训练数据这种几乎不允许犯错的任务。
测到最后的结论是,两者都很强,谁都没完全把对方打趴下。而更有意思的是它们在处理任务里体现出的不同思路,让人觉得这两个模型有着明显不同的“性格”:
MiniMax H3 更知道片子最后应该“像什么”,Seedance 2.5更知道导演刚才具体要求它“做什么”。
这也意味着,视频创作者终于有得选了,而且是两个完全不同的顶级选择。
1
三轮同题PK:各有取舍
为了尽量公平,我们把两款模型都跑过的案例放在一起,主要看:复杂指令能不能听懂,镜头和动作有没有执行,人物与空间能不能保持一致,画面有没有成片质感,以及声音、文字、商品等细节能不能稳定下来。
需要说明的是,本轮 Seedance 2.5 通过小云雀创作 Agent 测试,产品端可选输出为 720P;H3 的测试入口和输出规格不同。因此,我们可以比较审美倾向和任务完成方式,不能把清晰度差异全部归因于底层模型。
第一轮 导演级的指令跟随,运镜、打光
第一轮,我们先给两款模型塞了一份高难度的奇幻短片脚本。
场景是一座午夜闭馆后的自然博物馆:一只狐狸闯进大厅,撞见正在苏醒的霸王龙骨架,最后还要用鼻尖轻轻碰上去。
模型既要凭空搭起一个稳定的博物馆空间,又要处理狐狸奔跑、骨架苏醒这些完全不同的运动结构;而“一镜到底”又封住了它通过切镜掩盖人物变形和空间漂移的退路。
在这15秒里,我们还塞进了摇臂俯冲、低机位跟拍、甩镜、焦点转移、270度环绕和快速升高拉远五段运镜,同时要求倒影、遮挡、冷暖光线和声音准确配合。
Prompt:
负面要求:不要剪辑,不要闪白,不要镜头瞬移,不要让建筑旋转冒充环绕运镜,不要狐狸变形或变色,不要出现多条尾巴,不要让动物脚掌滑行,不要骨骼断裂或数量异常,不要霸王龙长出皮肤,不要错误倒影,不要穿模,不要背景漂移,不要焦点抽搐,不要突然改变镜头焦段,不要卡通风格。MiniMax H3输出效果:
Seedance 2.5输出效果:
两个结果的差异,第一眼就非常明显:
H3的电影感首先来自画面本身。狐狸、霸王龙、展柜和穹顶始终待在同一个稳定空间里,没有随着镜头移动胡乱换位;地面倒影基本同步,狐狸的毛色、体型和尾巴也保持了一致。最后狐狸靠近霸王龙,灯光依次亮起,摄影机快速拉远并升至大全景,全程一镜到底,很像一部奇幻电影的结尾。
但如果逐条核对机位分镜,完成度就没那么高了。开场的蓝鲸骨架俯冲完全消失,低机位侧面跟拍变成背后跟随,狐狸也没有真正奔跑。结尾进入画面的还是一条完整蓝鲸,并非骨架。
而Seedance 2.5 的电影感来自于运镜表现,它几乎把 H3 漏掉的分镜摄影指令都补了回来:镜头穿过骨架,机位平切到狐狸侧面,掠过石柱和展柜,狐狸真的奔跑起来,地面倒影与本体方向也正确。
可它的问题正好在另一面。压根没管“一镜到底”的要求,每个镜头单拿出来都像按 Prompt 拍的,剪到一起却不像发生在同一座博物馆,比如最后的ending大视角下,石柱直接消失了,结尾的几具骨架变成了有皮有肉的真实动物。
两者的不足之处,恰好是对方的优点。
第二轮:同拍一支百事广告,谁更接近商用
AI 视频除了做一些创意视频外,真正商用较多的还是广告和短剧,能做好这两个部分,视频模型才能真正进入生产中,而不只是创造者的玩具。
我们上传一张两罐百事可乐的产品图,要求模型严格保留罐体比例、深蓝包装、银色罐口、品牌标志、中文“百事可乐”和罐身上的白色舞者图案,做一个创意广告。
Prompt:
负面要求:不得改变罐体比例,不得修改包装设计,不得生成错误商标,不得让中文文字变成乱码,不得把两个罐子融合,不得增加第三罐产品,不得让舞者出现清晰真人面孔,不得模仿具体明星,不得出现多余手指或扭曲肢体,不得使用硬切、闪白或遮挡式转场,不得让可乐罐漂浮,不得出现卡通质感。图片参考输入素材:
![]()
MiniMax H3输出效果:
Seedance 2.5输出效果:
H3 保住了两罐产品的大部分关键元素。舞者从罐身走出、触发舞台、重新回到包装,创意形成了完整闭环。开场瓶身扫光、水珠、气泡、开罐声和鼓点都踩在画面节奏上;结尾广告语也准确清晰。
问题出在精确动作和镜头落点。舞者没有清楚完成后滑步,脚下的蓝色液体波纹没有出现;回到罐身时,立体舞者曾与包装上的平面舞者短暂共存;最后本应推向右侧罐体的镜头,也给到了左侧。
Seedance 2.5 的画面少了一点商业广告式的精致布光,舞者的后滑步同样变成了几步小跑。但它更准确地完成了二维到三维的转化,并在 Ending 把镜头交给了指定的右侧产品。
如果只看第一眼,H3 更像广告,但如果拿着分镜一条条验收,Seedance 2.5 完成得更准。
还是没分出胜负。
第三轮:四机位机器人训练,两边都翻车了
前三轮还在内容创作领域,最后一轮我们把难度推到了“世界模型”。
多摄像头 Ego 数据,是今年机器人训练中很流行的一类数据。它把相机安装在机器人的头部、胸前和左右手腕,从机器人自己的视角,同时记录“看到了什么”和“手是怎么操作的”。
相比固定在房间角落的第三方机位,Ego 数据更接近机器人执行任务时真正获得的视觉输入,多个摄像头还能补上手臂遮挡、物体离开视野等信息,让模型理解同一次抓取、交接和装配动作在不同视角下的对应关系。
从结果上来看,两款模型都失败了,各打一板。
Prompt:
负面要求:不要生成不同步的四段动作,不要复制立方体,不要左右手混淆,不要交换腕部视角,不要改变机器人结构,不要夹爪穿模,不要物体瞬移,不要违反重力,不要让未接触的物体移动。MiniMax H3输出效果:
Seedance 2.5输出效果:
H3 生成的四个画面都是一个视角;Seedance 2.5有视角差异,但是不管机器人主体还是运动都和Prompt的要求关系不大。
内容视频只要“看起来连续”就可能过关,机器人训练数据却要求每一帧都满足空间、时间、接触和相机几何约束。今天的通用视频模型已经很会拍戏,但距离可靠地模拟世界,还有一道很厚的墙。
1
H3 的强项:复杂的细节呈现
共同测试看完,这两款模型各自的能力还非常值得拆开看。
H3 最有辨识度的地方,是电影质感和丰富连贯的细节能力。它试图打破生成、参考和编辑之间的边界,图片给身份,视频给运动,声音给音色,文字给创作意图,模型把这些东西放进同一段上下文里理解。
我们来看一组500字的超长、复杂提示词表现。
Prompt:
负面要求:不要剪辑,不要人物变脸,不要改变服装,不要增加或减少手指,不要让物体突然出现或消失,不要错误倒影,不要文字乱码,不要画面闪烁,不要肢体穿模,不要不符合物理规律的水花,不要过度磨皮,不要卡通感。MiniMax H3输出效果:
H3 对这段长 Prompt 的整体理解很好。东京街头的大背景下,生成的人物角色非常日系,还原了弹珠特写中的“Moon 24”光斑细节,完全超出了预期。
另外,左右手交接、开伞、出租车经过、人物抬头和光线由冷转暖,基本按照顺序出现。人物面孔、服装和发型也保持稳定了。
但逐条对照就能看到它在精确执行上的取舍。镜头并没有真正绕人物旋转 120 度,更多是在用画面倾斜制造运动感;出租车经过后,雨伞和弹珠悄悄换了手;橱窗里的同步倒影也没有做出来。
只要你不拿着放大镜看,单看视频效果艺术感十足,值得被称赞一句开源SOTA。
1
Seedance 2.5 的强项:准确的镜头运动
而Seedance 2.5 最值得单独测试的是 30 秒直出。它的意义并不只是把生成时长翻倍,而是要求模型在更长时间内持续记住人物、空间和运动状态。在和 H3 同题 PK 时,也能明显感觉到,Seedance 对镜头运动的执行更准确。
30 秒真正增加的,是时间翻倍之后所有可能出错的东西。我们在新的Prompt里塞进了航拍俯冲、低机位跟拍、正面后退、固定俯拍、甩镜、环绕和车辆追踪,人物还要连续完成奔跑、翻越、滑行、起跳、上车和转弯。
Prompts:
五官清晰不变形,人体结构正常,服装发型一致,4K超高清,画面稳定,电影质感。不要生成水印,不要生成logo,保持无字幕。时长:30秒,比例:16:9。Seedance 2.5输出效果:
原本写进 Prompt 的八段镜头基本全部出现了,运动表现也很好,声音跟着动作走,脚步踩水、金属碰撞、卷帘门电机和摩托车启动声分别落在对应镜头里。
但致命的问题在于,镜头的最后,一艘本该在水面上的远洋货船,出现在了水泥地上。
1
开源搅动竞争,接下来更热闹
直接的对比之后,会发现两个模型有很不同的“性格”。
Seedance 2.5完成了更多明确写进Prompt里的镜头动作,在时间轴控制、原生30秒和大规模素材参考上,也依然有非常清晰的优势。
但有时更重要的是,当一个任务复杂到无法全部完成时,它们分别选择牺牲什么。
H3的错误大多是“少做”,例如在博物馆测试里,它漏掉了蓝鲸骨架俯冲和侧面跟拍,却守住了一镜到底、角色形象和空间连续;在其他测试里,它也会删掉部分动作,但会优先保证人物、场景、光线和音画关系仍然属于同一条片子。
而Seedance 2.5的问题则更容易变成“做错”。它可以完成更多指定运镜,却会通过切镜绕开一镜到底;可以拍完30秒的动作大片,却在最后把本应位于水面上的远洋货船放到水泥地上;可以调用更多素材,但对素材在整个任务里究竟承担什么作用,有时理解得并不牢靠。
在能力对比之外,价格也是一个很重要的因素。
H3官方2K定价为0.8元每秒,同时宣布即将开放权重;Seedance 2.5继续采用闭源产品路线,其上一代公开价格和我们此次的实际使用成本也明显更高,2.0 720P定价接近1元每秒,1080P超过2元每秒。
![]()
开源和低价不会凭空让一个模型变强,但当它的生成能力已经进入第一梯队,这两件事会让优势迅速从一次评测扩散到部署、适配、微调和整个开发者生态。
Seedance 2.5仍然很强。如果任务依赖明确的时间点、密集的镜头调度、原生30秒和大量参考素材,它依然是一个强大的执行工具,把视频生成推向一套更长、更大、更明确的工业化生产。
毕竟视频创作,并不是只有唯一答案的Benchmark,它同时包含审美、运镜、人物一致性、素材理解、时间控制、制作成本和工作流适配,不同任务对这些能力的排序完全不同,而MiniMax H3和Seedance 2.5已经明显处在同一个能力梯队,并在解决两种不同层次的问题。
两年前,我们还在问中国视频模型什么时候才能追上Sora。那时似乎只有一个标准、一个方向,以及一个需要追赶的答案。
而现在,这样强的视频模型,创作者们有了多个选择,甚至有开源选择了。接下来多模态领域的竞争会因此出现更有趣的变化,会变得更加热闹。
![]()
点个“爱心”,再走 吧
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.