剧组从200人砍到20人:AI视频消灭"抽卡"之后,最贵的岗位浮出水面
你今天听到的,和你真正做出来的,是两回事。
去年,MovieFlow 的系统里还有 20% 的代码是人写的。今年,这个数字变成了零,100% 由 AI 完成。
同一批人,正在把 200 到 300 人的传统电影剧组,压缩到 20 人。
这两个数字放在一起,就是 AI 视频行业此刻的真实水位:执行层的活儿,机器吃得比所有人预想的都快。
过去一年,这个行业被反复讨论的问题是"抽卡"。偶然生成一条好片不难,难的是每一次都能稳定生成一条好片。
在非凡资本最近的一场圆桌里,四家从不同方向解决这个问题的公司坐到了一起:做3D和物理可控视频生成的极泛流形、做视频 Agent 平台的 MovieFlow、做漫剧和 AI 视听的极速引擎 Anigo、做工业化批量生产的炫佳科技。
听完整场,我的感受是:"抽卡"这个老大难,正在被工程化快速消灭。但它消灭之后露出来的东西,比抽卡本身更值得琢磨。
消灭抽卡:四条完全不同的路,都走通了
角色一致性是抽卡的重灾区。单条视频里角色好不好看,难度不大;难的是第 15 个镜头里的人,和第 2、第 3 个镜头里还是同一个。
四家公司的解法,几乎没有重叠。
炫佳科技 CEO 秦林给的答案最"工科"。他的判断是:只要大模型还在用 Transformer 架构,去噪过程中每次生成的角色就必然有差异,单靠模型侧不可能彻底解决
所以他们在模型外面套了三层工程约束:输入主角时做样本锚定,生成差异过大就自动重绘;角色主体库和场景主体库双重约束;再拿大量专业摄影和导演术语做提示词工程。
效果可以量化:95% 的机械化生产,剩下 5% 人工调优。他们的 KinoAuto 模块,丢进去一本小说,4 小时后生成一部影片,接近零人工干预。一部 120 分钟的短剧,成本压到 5000 到 10000 元,一个人一天就能完成。
MovieFlow 创始人梁巍的路子完全不同:真人打底。他们原来是做电影的,现在的做法是建一个真人演员库。
物理世界里这个人真实存在,采集得足够清楚,再做加权和训练,之后调用他就跟调用照片和素材一样,基本不会有一致性问题。
这套打法的市场反馈也不错:MovieFlow 上线快一年,全球 150 万用户,覆盖 170 多个国家。
极泛流形的黄乃元最坦诚。被问到角色一致性怎么解决,他直接说:"还是要交给大模型去提升。"
他们All in的是3D和物理可控的视频生成,就是保持场景背景和物体的一致性,让空间关系和镜头运动更可控,让生成结果更符合物理逻辑。例如,先明确场景结构和机位,再交给视频生成模型执行,从而提高同一场景在不同镜头下的一致性。
Anigo 的王俊则把宝押在智能体工程化上:把什么任务交给什么样的 Agent,决定了角色稳不稳。
四条路,原理互不相同,但每条都拿出了能交付的结果。这本身就说明一件事:角色一致性已经从一个技术攻关问题,降级成了一个工程选型问题。选哪条路都行,反正都能到。
脸不崩只是入门,戏不崩才是难题
但聊深了会发现,"脸保持一致"只是最容易的那层。
王俊把一致性拆成两层:视觉一致性和叙事一致性。视觉层面,大模型本身的能力已经做得很好。难的在长篇:单次生成有 30 秒上下的边界,超过这个长度,问题就变成了 Agent 之间如何协同,维持角色在叙事层面的连贯。
他举的例子很形象:前一个镜头里角色还非常兴奋,下一个镜头突然变得拘谨。王俊的原话是:"一开始他可能是个疯子。"
梁巍管这个叫表演一致性,话说得更直。
我们看戏看的是表演,光是脸像其实没有意义。
一场戏里,角色可能从愤怒到平和,再到愤怒,最后和解。这个状态的流动才是一场戏。纯 AI 要做到这一点,目前确实麻烦。
秦林那边也承认边界。95% 之外的那 5%,集中在极端情况,比如大幅逆光。但他给了一个有意思的对照:现实拍摄里,逆光同样会让面部难以识别。
AI 的短板,有一部分本来就是摄影的短板。
"镜头再收一点",收多少?
镜头控制聊出来的结论,跟技术关系不大。
王俊说,很多人会跟 AI 提"镜头推进一些"这种需求。但什么叫推进一些?真交给执行导演,他一定会把需求追问到非常细:怎么走,走多少。这是个极其模糊的指令。
梁巍把这个话题彻底挑明了。他说,今天把任何一个人放到正式片场,都能坐上导演椅喊"Action"。AI 也一样:你提出需求,喊一声 Action,全剧组几百人开始干活,演员拼命演,摄影机拼命拍。
难的是喊"Cut"。
"你喊了 Cut,全场停下来看你,他们在等另一个结果:这一条到底 OK 不 OK?"
王俊补了一句所有用过 AI 生成的人都会心一笑的话:一般用户只会说,"我感觉不太对,你再想想。"
那到底什么才叫行?梁巍的判断是,大语言模型处理了中间 98% 的工作,但所有人期待的,是最后那个导演判断。
所以工具层没有本质区别:"今天你有 3D 导演台,明天我也能有。"真正的区别在于使用者,让张艺谋来做同一场戏,出来的就不是一回事。
AI 把所有人的底线从 0 分拉到 80 分、90 分,结果导演专业反而更值钱了。
200 人砍到 20 人,砍掉的全是执行
剧组从 200 人压缩到 20 人,谁留下了?
梁巍给的清单是:编剧、导演、融合了摄影指导能力的美术指导、懂表演和剧情的表演指导、物理世界里的主要演员,还有剪辑。
剪辑被单列出来讲。短剧、漫剧可以一键剪,因为 2 秒、3 秒、8 秒、10 秒都有相对标准。但电影剪辑没有标准。
蒙太奇可以在某个瞬间"咔嚓"一剪,让你吓一跳;也可以故意一直不剪,让你烦,让你期待后面到底有什么。
剪辑是第三次创作,AI 目前无法替代。
秦林从另一个角度给出了同样的结论。他说有两个环节是智能体和模型解决不了的。
第一个是剧本:很多人用 AI 写小说、写剧本,但都触及不了人类情感的灵魂,因为"机器只能从已知导向已知,不能从已知导向未知",而人最厉害的地方,恰恰是想象未知世界。
第二个是顶级导演对镜头感和美感的把握,审美很难被参数化、被蒸馏。没有人工干预,纯 AI 成片的天花板就是七八十分。
于是未来的协作框架很清晰。梁巍的表述是:人负责最前面的 1%、交付结果后的 1%、提出下一轮要求的 1%;中间每次执行的 98%,交给 AI。
这 20 人剧组减少的,是大量执行性的体力工作。而从事创作、有判断力的人,一个都没走。
下一个 Vibe Coding,会是视频生成吗?
聊到这里,还有一道绕不开的判断题:AI 产品的下一个 Vibe Coding,是视频生成吗?
秦林拆过 Vibe Coding 能跑通的原因:代码有规范、有标准、重复频率高。越标准、越高频,越容易商业化。
沿这个逻辑,现阶段 AI 视频真正跑通的单一场景就是短剧,因为短剧恰恰最符合代码的逻辑:公司化、流程化、标准化,创意占比低,是典型的爆米花式内容产品。
他眼里的未来视频分两块。一块是精品电影:好导演加好工具,几百万到 1000 万就能做出原来要几个亿的电影。
另一块是纯工业化生产的短剧、广告、电商、数字人。两块加起来,未来 10 到 15 年,可能是一个 10 万亿级的产业。
黄乃元的提醒更冷静:Vibe Coding 大概率只能解决视频生成里的一小部分问题。做产品要看清楚,哪些事是视频生成基模中短期内不会覆盖的。水位一涨,只做简单加工的产品会先被淹没。
梁巍的答案最锋利,也最像给所有人的建议。第一,不要焦虑技术。今天讨论的一致性、剧组管理工具,一定会有人做好,不需要每个创作者亲自操心。
第二,抓紧入场。技术进步已经远超想象,他们和香港电影人合作的成熟剧集,成片已经完全看不出 AI 痕迹。
他甚至判断,未来可能出现一部"非洲版《甄嬛传》",背后制作团队全部来自中国,因为全世界 AI 视频制作最强的地方就是中国。
他最后一句话,我想直接用作这篇文章的结尾:
你今天听到的,和你真正做出来的,是两回事。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.