![]()
作者|赖捷 王宇锟
编辑|张洁
这个夏天,视频大模型赛道“卷疯了”。
字节发布Seedance 2.5,Minimax开源H3,阿里的WAN 3.0也于8月24日正式上线。
国外方面,马斯克不断在x推广自家的Grok Image Video,德国黑森林实验室的Flux 3.0成为黑马。
工具越来越多,创作者到底选哪家?
![]()
Seedance 2.5领跑,
白模参考正重塑影视工作流
Seedance 2.5发布后,已经在长视频、电影级画质、画面真实性上,证明了它的领先优势。
“AI新榜”之前做测试发现,Seedance 2.5新增的3D白模生成视频功能,非常惊艳,能精确控制人物动作、物体物理轨迹变化。
与此同时,越来越多视频模型、画布工具,开始比拼起关键帧控制、细节编辑、脑补剧情等能力。
但问题也来了,创作工具虽然很多,但创作者依然要回归那个最根本性的问题——性价比。不但要考虑生成视频的质量,也要考虑价格、生成速度、抽卡次数,通过综合衡量选择适合自己的模型。
真实创作中,很多人只是想批量生产短片、电商引流广告、宣传片,并非每条视频都要用上“电影工业级画质”。
也因此,本次测评我们主打一个真实生产环境,重点对比模型们在720p这个维度下的生成性价比,选择了Seendance 2.0 fast、Wan 3.0、Minimax H3三大模型。
它们的最新价格也接近——Seedance 2.0 fast API价格是0.6元/秒,Wan 3.0(720P)API价格也是0.6元/秒,H3(768P)API价格则为0.5元/秒。
为什么选720p这个参数?这是大部分平台的基准画质要求,且720p对手机用户肉眼来说已经够用,同时在真实生产中,不少创作者为了极致省成本,会先测试生成720p视频,再升级为1080p。
![]()
八大考题实测,
谁是视频模型性价比之王?
考题:模拟“牛来牛奶”广告。
考点:模型是否主动突出广告记忆点
我们给定了“牛来”形象参考图,牛奶产品图,并给出了相同广告词——“牛来牛奶,真牛奶,真的牛。我们不产牛奶,我们只是牛奶的搬运工”,让三个模型在完全相同提示词下,生成15s广告短片。
三个模型都完整按提示词完成了短片,而且都只抽卡两次。
细究起来,Seedance 2.0 fast的表现更有戏剧性,体现在动作中,它自动脑补了“牛来”没接稳牛奶的画面,音频上采用了更戏剧化的表达,符合我们印象中的广告片味道。
Wan 3.0的表达,同样非常有电视广告感,配乐也较到位;H3的表达比较中规中矩。
考题:15秒内精准表达“刻舟求剑”
考点:模型对故事逻辑的理解能力
这是一个地狱级难度的考试,需要大模型在15秒内,至少依次表达五组画面——船在行进、剑掉水里、人在船上刻标志、船继续前行并靠岸、人下船按照标志找剑。每个画面缺一不可,每个画面转场都得顺畅,否则故事不完整。
为了公平起见,这一轮我们只抽卡一次。从结果来看区别比较大,仔细看对比视频:
这一次抽卡中,Wan 3.0和H3,其实都没表达出“刻舟求剑”故事中的关键画面——船继续行走靠岸后,人才下水捞剑。它们的视频中,人都是在刻完标志后即刻下船捞剑。而Seedance 2.0 fast,给出了一秒船继续游动并靠岸的画面,基本体现出了故事的荒诞性和寓意。
考题:15秒还原精卫填海
考点:国风动画质感,IP形象塑造,故事流畅性
中国风传统经典故事,是很多创作者比拼的重要赛道。
这一轮各有千秋,我没给角色形象参考图,只给了故事大纲,Seedance 2.0 fast的动画形象,比较有质感和IP感;Wan3.0的镜头表达更细致,特别是在“精卫葬身海底”“精卫化身神鸟”“神鸟叼走树枝去填海”这三个关键节点,都给出了特写,强化了故事表达。
考题:蜜蜂穿越丛林
考点:是否穿帮,是否理解生物与重力关系
蜜蜂在密集丛林中穿行,画面元素非常多,理论上是非常容易穿帮的,常出现穿透树叶、机位跑到蜜蜂前方的镜头,这轮测试中,各家画面一致性都保持得比较好,这说明视频模型整体上都在大幅度进步。
但Seedance 2.0 fast还是有更突出的地方,它对蜜蜂飞行中的物理轨迹还原得比较好,因为生物有重量,受到地心引力牵引,飞行中要不断克服这种力,特别是起飞、升高时,需要更加有力,因此真实生物的飞行状态并非平均用力,也不可能是轻飘飘的。大家细看Seedance 2.0 fast的生成,是不是更有节奏感。
考题:川剧变脸现场表演
考点:一镜到底下运镜表现力、服化道准确性
这也是地狱级难度,因为既要还原川剧画面、声音,在换脸时还要丝滑到位,同时镜头还得随着表演者不断旋转的身体变化,时而给中景展现动作、时而拉近、时而给出脸部特写。这一轮,我同样没给参考图,提示词也一模一样。
三家模型的基础运镜是到位的,Seedance 2.0 fast和Wan 3.0多了从远景切入的纵深感。
比较突出的还是Seedance 2.0 fast,它的运镜是“动起来的”,会随人物动作变化而切换,同时不会给观众带来眩晕感,大家看演唱会视频就会发现,这种运镜会有更强现场冲击感,而在现实中要实现这种运镜,往往要借助伸缩炮等专业设备,每天租金上千。同时,Seedance 2.0 fast 对川剧形象的还原相对更好。但也稍有遗憾,这条视频第八秒时有细微的卡顿。
考题:末日楼顶逃生
考点:人物运动的物理逻辑真实性
这轮测试的主题是末日丧尸来袭,主角在楼顶跳上直升机,这是很多科幻短片会用到的场景。重点是主角逃跑的线路、步态;飞跃并抓住直升机的物理轨迹;以及飞跃瞬间丧尸们拼命想抓住主角的特写。
可以看到,三大模型的还原都是比较到位的。Seedance 2.0 fast依然更有真实运动感,慢动作更细致。Wan 3.0在这轮中有个小问题,就是主角的飞跃距离过远。
考题:传统三人对话文戏
考点:真人短剧里,人物空间位置关系一致性
这种三人对话场面,如今属于大模型们的基础能力。
可以看到,三家模型都清楚交代了座位关系,在切成单人近景后,也没有越轴或左右颠倒,开场与结尾的主镜头也始终保持在同一个空间。
考题:贝克汉姆60米吊射
考点:对复杂运动竞技场面的还原度
当然了,现有的大模型在复杂的运动视频上,依然是有缺陷的。
我用这三家模型,测试了“NBA球星运球上篮”“贝克汉姆六十米超远距离吊射”等场景,在还原复杂的多人球类运动物理轨迹时,它们都会出现各种各样的问题,大家可以看看。
也因此,这些模型可能并不适合用来做运动类竞技类视频。
![]()
总结
最后再总结下这轮测试。
从价格来看,这三家比较接近,H3每秒便宜约0.1元;
从生成速度来看,这轮测试都选择了工作日下午同时抽卡,Seedance 2.0 fast的平均生成时间是5分钟,H3大概8分钟,Wan 3.0或许由于正式版刚发布等原因,时长接近10分钟。但相比以前,它们的生成速度都大幅度加快了。
从抽卡成功率来看,以上展示出的视频,Seedance 2.0 fast和Wan3.0平均每条抽卡两次,H3略高。这里抽卡成功的含义是——模型已忠实还原了提示词的描述,没有重大物理硬伤。
而从最重要的画面质量看,至少从以上测试可以看出,Seedance 2.0 fast对物理世界的还原以及镜头的运用,个人觉得是更成熟的,特别是在蜜蜂飞行视频中,它对重力关系的理解非常到位。而这两项关键指标,直接关系着大部分视频的实际制作效果和成本。
当然,这只是本次测试的结果,在不同场景下,各大模型会体现出不同能力。而Seedance 2.0 fast在画面上的表现,依然是制作短片短剧广告等场景下,比较稳健的选择。
欢迎分享、点赞、推荐
一起研究AI
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.