我们做了一次横向实测,选的是同一个宫斗剧情提示词,投喂给三款主流模型——海螺AI H3新版、Flova1.0、可灵King3.0。结论出得很快:画面都能跑出来,但戏演不了。
Flova拍不出“眼神戏”。贵妃该有的妒意、嫔位隐忍的不甘、皇后不动声色的威压,全部缺席。优化工作流能把视频修得顺滑,却补不上模型对人物心理的理解缺口。海螺AI的角色人设直接错乱:大臣被生成太监,皇后全程闭眼沦为背景板,贵妃挑衅时的眼神转动僵硬机械。只有可灵生成的那版,能清楚分辨皇后、贵妃、嫔侍、宫女之间的层级差异。
![]()
一位杭州的AI算法工程师张扬拆解过这个差距。他说,文本大模型本质上在玩“猜字游戏”,推算下一个输出Token。可视频要同时照顾连续画面帧、人物互动、服化道、剧情因果链,信息量和不确定因素比文本高出一个量级。生成过程更容易失控。这也是AI漫剧行业催生“抽卡师”这个岗位的原因——从反复生成的素材里,挑最好的镜头和人物。可灵和即梦背靠字节和快手的内容池,在中文内容、古装题材和人物关系的训练与产品调优上更充分,跑出来的效果自然更稳。
写实类剧情的要求又往上抬了一档。不能只追求画面好看,还要遵循人物礼制、道具常识、动作逻辑与大众认知。AI有自由创作的空间,可商用成片必须贴合现实规则。我们用盗墓题材测试了一次:让各家模型生成二十四山专业罗盘。海螺AI、Flova、可灵AI没有一家能正确还原罗盘的样貌。反复调整提示词重试,海螺AI甚至生成了离谱画面——罗盘变成盾牌。
腾讯视频上线的AI精品短剧《北派笔记》遇到过同类问题。创作团队让AI生成“洛阳铲”,AI给出的是普通铁锹。提供了准确参考图之后,人物做出挖掘动作——铲下去的是洛阳铲,拔出来时又变回普通铁锹。这意味着模型不仅要保证单帧还原,更要保证连续画面不变形、人物操作符合常识。这件事到现在为止,仍然需要专业垂直数据集、结构性约束、生成后人工质检多重手段一起上。《北派笔记》团队的做法是,单独采风、搜集资料、建立标准,再进行针对性模型训练和资产制作。
英国生成式AI媒体公司Synthesia的CEO Victor Riparbelli点明了这个赛道的根本吸引力:和传统实拍相比,AI做视频的成本极低,不用再依赖真人演员、专业拍摄器材、实体影棚。Fortune Business Insights的数据显示,全球视频AI生成工具市场规模将从2025年的7.168亿美元攀升至2034年的33.5亿美元。价值很可观,短板也很明显。
当赛道格局清晰分化——即梦、可灵等大厂系背靠海量内容场、资金储备与完整生态闭环,能够用生态摊薄试错成本——独立厂商面临的劣势便越发清晰。他们没有完整的真实数据反馈闭环。用户使用即梦或可灵创作的视频,字节和快手能追踪整条链路:最终选用哪一段、怎么剪辑、是否正式发布、完播率多少、转化效果如何,全部可追溯。这种真实数据反哺持续优化模型,而且内容、广告和生态业务还能分摊反复生成带来的试错成本。
大多数独立AI工具只能看到用户输入了什么、生成了多少次,无从判断是人物崩坏、道具出错、剧情违和还是审美问题导致成片作废,也难以衡量用户生成的视频真实的播放量是多少。这意味着,独立厂商需要一边追赶模型效果,一边独自消化失败生成造成的算力消耗和用户流失。
这样的劣势之下,国内独立视频AI模型厂商没有硬碰硬,而是走出了五条差异化路线。
第一条是以海螺AI为代表,打造通用多模态基座,面向全球市场推订阅服务,同时开放API对外合作。海螺AI持续布局海外生态,先后接入VEED、Envato Video Gen等海外创作平台。在张扬的视角里,这套模式是典型的“发动机模式”:搭载自家C端产品“卖整车”,对外输出API能力“卖配件”。想要摊平高昂的研发和算力成本,就要扩大模型调用规模,分摊前期硬件与训练投入,积累真实场景数据迭代优化,构筑性价比优势。但过硬的底层模型不等于稳定交付成片。人物关系错乱、道具失真、剧情衔接断裂这些问题一旦出现,都会变成合作方的返工成本。Mini Max招股书披露的一个数字是:截至2025年9月30日,海螺AI累计用户4234.8万,创造收入1746.4万美元。
第二条是Flova的路线:搭建项目资产体系、多模型调度能力与一体化AI创作工作台。张扬解释,做视频往往需要联动文生图、视频生成、配音等多种模型,而Flova相当于一名“AI总导演”,把工具聚合到统一工作台,项目内角色和造型素材一次设定、持续复用。这套方案运行成本更低、素材复用效率更高,却有一个难以绕开的短板:某个模型输出不稳定,即便有“总导演”统筹,镜头准确率也难以保障。今年7月,Flova母公司雨舟科技获得红杉中国、IDG资本、云九资本合计超8000万美元融资。
第三条是Vidu的路:聚焦人物与场景一致性、连续化内容生产,配套完整创作工作流。漫剧和系列长视频创作中,角色形象前后不一、频繁“变脸”是致命缺陷,而Vidu的核心价值在于角色和场景设定一次完成后可以反复调用,不用每段素材都从头反复“抽卡”。Vidu母公司生数科技披露,2025年实现用户和收入超10倍增长,印证了市场对连续内容生产工具的旺盛需求。不过我们实测Vidu Q3模型时,发现画面观感精致却存在明显漏洞:片段前半段女主没有围巾,后半段凭空多出一条厚重黑色围巾;人物相互靠近时生硬平移,观感近似统一角色设定的静态剧照拼接。它能在连续生产上往前走,但人物与场景的稳定可控,仍隔着距离。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.