来源:市场资讯
(来源:懒人 AI新榜)
![]()
编辑 | 张洁
又一个中国视频模型登顶了。
在Artificial Analysis(海外第三方AI模型评测机构)的视频编辑榜上,Wan3.0以Elo(竞技场评分系统)1190分独居第一,领先第二名62分;文生视频榜(含音频)以1240分居首,与Google Gemini并列。
Wan3.0于8月6日开启公测,24日正式上线。这段时间,AIGC创作者圈子里已经用它做出了不少作品。参与过Wan历次大版本内测的AI创作者“Simon_阿文”与“海辛Hyacinth”认为,Wan3.0是“最大的一次惊喜”;小红书创作者“薇九”的《神女异梦》全片用Wan3.0制作,“质感细腻,720P几乎没有出现任何模糊面部”;创作者“玖月AI”用Wan3.0做了一场东方神话里的破执大梦,笔记发布一天就获得1.2万赞。筷子科技CTO陈龙则说,成片“接近真实广告拍摄水平”。
![]()
榜单排名和创作者反馈的双重叠加,似乎让我们看到AI视频新的“两强”格局,但不急着下判断。
因为竞技场回答的是“能力有多强”,创作者回答的是“实际怎么用”,而决定一个视频模型能不能进入生产线的,还有一套更重要的标准:能不能稳定出片,能不能经得起商业验收,能不能把细节和画面质感做到足够可靠。
带着这三个问题,“AI新榜”也从影视制作、商业广告、音乐娱乐、企业办公等几个方面对Wan3.0进行了实测。
![]()
30秒武侠短剧稳定直出,
还有智能时长主动省积分
我们先试了一条30秒武侠短片,完整叙事直出,含多个镜头切换:雨夜荒野客栈,老刀客独坐堂中,手按一只旧木箱,黑衣人破门劈桌,刀客拔刀迎击、反手一剑;最后特写,木箱里没有秘籍镖银,只有一把刻着孩子名字的小木剑和一捆用红绳扎好的信。
成片里有几个细节超出了我们的预期。开场,提示词里只是写着角色手按旧木箱,但成片里,人物的手在木箱上摩挲,这一个小动作的处理和最后的开箱形成了呼应。还有,听到门被撞开的声音,人物也是眼神先动了一下,然后转身接招。这些提示词里没有明确写的细节,让整段故事显得更立体。
音效也没有全部糊成一团:刀剑声、攻击声、雨从破门灌进来的声音,层次分得开。到了结尾特写,人物手部浸血,表情不木讷,几乎没有明显AI感。当然,问题也有,和提示词的表达也有关系。比如,打斗戏里人物手里突然多出一把剑,武打动作不够连贯。
但这一条片子跑完,我们发现,只要提示词里的人物设定和剧情信息量给足,30秒的叙事短片已经具备可用性。这也是为什么井英科技CTO王健把Wan3.0称为“短剧规模化生产的关键引擎”。
但生产线真正头疼的,往往还不是第一次出片。而是那句“这里需要改一下”。
我们继续用刚才那条武侠片,看看Wan3.0的视频编辑能不能满足实际生产中的返工需求。我们在提示词里要求把原结局的“打开木箱”改为“抱起木箱走向客栈大门”,把原来的台词“丫头,爹做完最后一单就回家”变成新的旁白“树欲静而风不止,是时候做个了断了”。
操作也很简单,在原视频的基础上选择“视频编辑”,选中要修改的片段,再输入修改要求即可。
这是修改后的片段:
只有指定的结局发生了变化。人物、位置、背景全部保持原版一致,连地上躺着的刺客都还在原来的位置;原有台词被去掉,新旁白按要求生成。
通宵返工改过片子的人,大概能立刻理解这一刻的“救赎感”。如果每次修改一个细节,都必须整条视频重新抽,那么模型再强,也很难真正进入商业生产。能够只改指定片段,还能稳定地输出修改结果,节省的不只是时间,还有反复抽卡和重新制作的成本。
还有一个让我们很惊喜的功能:智能时长。Wan3.0会根据提示词的长短自动判断生成时长,多出的部分返还积分。
别看这个功能小,放到生产线上,同样能省下不少积分。我们之前测其他视频模型时,打斗提示词写得简单,但设置了30秒时长。结果,天台上两个人愣是抱着滚了十几秒。如果放实际生产中,这段还得后期剪掉,积分也白花了。有了智能时长,这一部分浪费直接被系统拦掉。
![]()
![]()
实测制作商品广告和音乐MV,
人物与产品细节都经得起看
广告行业看AI短片的眼光更挑剔:人物不能飘,Logo不能变,产品细节必须和实物对得上。
我们又试着做了一条30秒的商品广告片。
一张人物参考图,设定半写实漫画风格的女性角色;一张白底产品照,黄色易拉罐气泡水,罐身带白色大字标签和银色拉环。三个镜头硬切:人物走进便利店从冰柜取出饮料、罐身特写水珠顺罐壁流下、拉开拉环喝一口。要求冷灰蓝色调,真实广告拍摄感,皮肤毛孔可见。
成片相当惊喜。
逐镜核对下来,人物的服装、发型、配饰全程一致性较好,皮肤和动作细节也保持了真人感。放大看手部,动作、指甲、掌心纹路都很自然。
产品细节上,lemon soda的英文正确,“0糖0卡0脂”等中文字准确,瓶身的气泡设计也没有被忽略。场景也没有偷懒,便利店的货架上合理摆放了指定饮料之外的其他商品,环境真实感一下就有了。
这其实是广告视频真正需要的“真实”:不是单项能力特别惊艳,而是人物、商品、文字和环境同时不出大问题。
当然,也有两个小问题。一个是水珠,我们的本意是饮料从冰柜取出到常温、自然凝结的水珠,但提示词没写清楚,模型理解成了外部来源,加了一个凭空往瓶身滴水的镜头。另一个是镜头切换:人物转身走向冰柜那一下,冰柜有点像凭空出现在转角。这说明物理细节和空间逻辑,仍然需要在提示词里主动写清楚。
但整体而言,筷子科技CTO陈龙说Wan3.0的成片“接近真实广告拍摄水平,帮客户更快出爆款”,从我们这条片子看,这个说法并不算夸张。
广告之外,音乐行业也能用它。我们复刻了一个门槛极低的玩法:一张人物图加一段音乐,生成对口型MV。
输入的是一张练习生人物图和一段13秒的音频,要求以图中人物为主唱,全程对口型演唱。
这是出来的成片:
人物动作适配音乐节奏,口形和歌词完美匹配,服装、发型、配饰也与参考图一致。这也和专业音乐人的实际体验比较接近,小旭音乐CEO卢小旭体验后的评价是,“成品直接可用,非常适合做MV”。
![]()
一份PDF直接生成视频,
企业文档秒变生产资料
AI视频真正进入企业场景后,“好看”和“人物逼真”反而没那么重要了。课件、产品演示、业务汇报,这些内容没有炫技空间,拼的是信息准不准、画面经不经得起放大。
Wan3.0这次首次支持文档格式输入,doc、xls、ppt、pdf、md等都能直接上传当视频素材。
我们做了一个更接近企业实际需求的测试,虚拟了一个智能戒指的品牌。直接扔一份产品说明PDF、一张产品图,要求制作30秒产品宣传片,展示戒指功能。没有给其他东西,也没有另外去整理产品的使用场景。
![]()
成片在这里:
模型自动从产品说明PDF里获取了运动、办公、睡觉等场景,解说词讲清了产品和场景的匹配关系,画面配了人物敲电脑、睡觉的手部佩戴特写。放大看,汗毛和指关节纹路都清晰可见。
更重要的是信息全都准确,重量、续航、蓝牙、产品名称,所有出现在视频里的产品参数,都来自上传的文档,没有编造;字幕文字无错误,戒指全程没变形,logo没有移位、错误或消失。
这意味着,企业手里的PDF、PPT、产品手册,以后能直接变成视频生产资料。过去需要人工阅读、拆解、提炼,再重新制作的视频,现在可以直接把原始资料交给模型处理。
我们还试了几个场景,给它奥本海默的百科链接,直接帮我们做知识类的短视频:
给它阿勒泰地区的百科链接,帮我们做文旅宣传短视频:
当然,我们喂的东西比较粗。可以看看这个杭州的文旅视频,每一处地标都重新“活”了过来。
画面流畅生动,质感太好了。所谓“质感”,不是简单追求一张漂亮的截图。
它意味着两件事:信息经得起核对,画面经得起放大。当视频开始承载企业产品、业务信息和品牌表达,这两件事的重要性甚至超过了某一个镜头够不够惊艳。
![]()
当AI视频工具成为基础设施
最后说一个所有企业都会关心的现实问题:价格。
目前Wan3.0 API刊例价480P/720P/1080P分别对应0.3元、0.6元、1.2元一秒,7折活动持续到9月23日,一条30秒的1080P成片,折后25元左右。
回头看这次实测,其实我们在对应三种生产能力。稳定,对应出片率和返工成本,短剧团队不再只关心“能不能生成”,而开始关心“多少次能出片、改一次会不会全片重来”。真实,对应商业验收,广告客户需要的不是一段看起来很像真人的视频,而是人物、产品、Logo、文字和空间关系都能经得起检查的成片。有质感,对应的是信息承载能力,当PDF、PPT、产品手册都可以成为视频的输入,视频就不再只是视觉内容,而开始成为企业信息的一种新载体。
我们并不是要追问哪个模型可以替代别人。相反,模型能力整体往上走,企业和平台就又多了一个选择,可以按自己的生产需要选最适配的模型。而我们发现,当一个AI视频模型能够被企业接进生产线,拿来批量生产、控制成本和实际交付,它就从工具变成了基础设施。
而榜单上的那个名字,真的坐到了工位上。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.