网易首页 > 网易号 > 正文 申请入驻

ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事

0
分享至



刘恺骐,北京大学博士生,主要研究方向为可控视频生成、音视频联合生成、世界模型、理解生成统一模型及多模态大模型等,相关成果发表于 ECCV、ICCV、CVPR 等国际会议。

过去几年,视频生成模型在清晰度、运动表现和画面质感上不断进步。输入一句文字,模型已经能够生成颇具电影感的视频。

但当任务从「生成一个漂亮片段」,变成「完整拍完一场戏」,问题就不一样了。

前一个镜头里,女主说完一句话;画面随即切到男主,他停顿片刻后作出回应;接着镜头切回女主,而男主在画外继续说话。要完成这段内容,模型不仅需要知道画面中有什么,还要准确执行一系列叙事约束:何时切镜?谁在什么时候开口?对白能否与口型和动作对应?切镜之后,人物的脸和声音还能否保持一致?

即使这些要求已经写进脚本,现有模型仍可能出现切镜错位、对白提前或延后,以及多人场景中的串脸、串音。问题不只在于故事有没有说清楚,更在于模型内部是否具备沿着复杂时间线组织音视频内容的能力。

为此,北京大学、可灵团队、中国科学院自动化研究所和中山大学联合提出MAVIN,一种支持定制化叙事控制的多镜头音视频联合生成模型



视频链接:https://mp.weixin.qq.com/s/44G9L1IOaESUT1O5ZVuU_A

目前,该论文已被ECCV 2026 以 Oral形式接收。刘恺骐为第一作者,翁书晨、施柏鑫为通讯作者。

  • 论文标题:MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control
  • 作者单位:北京大学、可灵团队、中国科学院自动化研究所、中山大学
  • 论文地址:https://arxiv.org/abs/2606.29473
  • 项目主页:https://liukqchoco.github.io/MAVIN/

一、会生成电影感画面,

为什么还「拍不完一场戏」?

多镜头音视频叙事至少面临三类挑战。

首先是时间错位。模型可能知道脚本中有哪些人物和事件,却无法判断它们应该出现在哪个时间段:镜头已经切换,上一名角色的声音仍在继续;人物尚未出现,对白却提前响起。

其次是身份混淆。同一名角色跨镜头出现时,不仅要保持面部、发型和服装一致,也要维持稳定的音色;多名人物交替对话时,还要避免串脸、串音和说话人绑定错误。

此外,用户通常只会输入一段故事梗概,很少完整标注镜头边界、对白区间、角色外貌和声音事件。系统既需要补全一份可执行的剧本,也需要真正按照这份剧本完成生成。

因此,MAVIN 要解决的并不是简单的「多生成几个镜头」,而是让模型学会在一条统一的叙事时间线上,调度画面、对白、动作和角色身份。



二、核心思路:

把「叙事时间线」真正写进生成模型

MAVIN 采用全局、镜头和角色三个层级的结构化脚本,统一描述整体情节与背景音乐,各镜头的起止时间、画面内容与人物动作,对白内容及其时间区间,以及角色的视觉外貌与声音身份。

模型建立在双塔音视频联合生成架构之上,视频和音频分别在各自分支中建模,并通过跨模态注意力交换信息。围绕「何时发生」与「由谁发生」,MAVIN 提出了两项核心机制。



1. 边界感知注意力:让镜头与对白在叙事时间线上精准落位

视频生成模型通常让整段文本影响所有音视频位置。这意味着,模型在生成第一个镜头时,也能读取后续镜头的描述,容易造成后一个人物提前出现、上一段对白串入下一镜等「语义串场」。

MAVIN 根据镜头边界划分视频特征,根据对白区间划分音频特征,再通过动态 token 路由,为不同信息限定明确的作用范围:镜头描述只影响对应片段,角色外貌只在其出场镜头中生效,声音条件也只作用于相应的对白区间。

由此,镜头切换、人物动作和说话时间不再只是提示词中的「软要求」,而成为模型内部能够执行的时间约束。

2. 身份感知传播:镜头可以换,演员不能「掉线」

MAVIN 可以同时接收角色参考图像和参考音频,并通过专门的音色编码器,从参考语音中提取「是谁在说」,而不是复制参考语音「说了什么」。

在此基础上,身份感知掩码进一步限制不同人物之间的信息传播。每个镜头只读取实际出场角色的视觉参考,每段对白只读取当前说话人的声音特征;同一角色的文字、画面和音色相互绑定,不同角色之间则保持隔离。

这相当于为每名角色设置独立的视觉与声音锚点,从而减少多次切镜后的身份漂移,以及多人对话中的串脸、串音。

3. 多智能体脚本流水线:先把故事补成一份「可拍」的剧本

面对自由形式的用户输入,MAVIN 还设计了一套轻量级多智能体流水线。

结构解析智能体负责识别场景、角色和对白,并划分镜头与对白区间;身份对齐智能体匹配人物与参考图像、参考声音;叙事细化智能体则补充动作、镜头语言和环境声音,最终形成全局、镜头和角色三个层级的脚本。

它负责「把拍摄计划写清楚」,边界感知注意力和身份感知传播则负责「按计划真正拍出来」。

三、MAVINSet:

让模型从数据中学会「一场戏该怎么拍」

要让模型学会执行镜头、对白与角色约束,训练数据也必须包含完整的叙事结构。然而,现有音视频数据通常只提供整段内容描述,缺少镜头边界、对白时间以及跨镜头的角色信息。



为此,团队构建了多镜头音视频数据集MAVINSet,收录数十万条时长 3 至 15 秒、包含 1 至 6 个镜头的样本。不同于普通视频字幕,MAVINSet 为每段内容提供全局、镜头和角色三级标注,覆盖故事进展、镜头内容、人物动作、对白文本与时间,以及角色的外貌和声音特征。

对于跨越切镜点的对白,数据还会记录其在不同镜头间的延续关系。这样,模型看到的不再只是一段音视频,而是一份包含画面、声音、人物与时间信息的完整「分镜表」。

四、实验结果:

不仅时间更准,角色也不再「串线」

研究团队将 MAVIN 与两类代表性方法进行了比较:一类先生成多镜头视频,再通过视频到音频模型补充声音;另一类则是端到端音视频联合生成模型。

视觉对比



在同一段三镜头雪地对话中,现有方法容易出现角色外貌漂移、镜头顺序错乱或对白与人物对应不准等问题。相比之下,MAVIN 能够更完整地执行镜头切换,并在不同镜头间保持人物身份与场景风格,同时让对白与角色之间的对应更加准确。

定量指标



在涵盖音视频质量、语义一致性、音画同步与多镜头控制的 13 项指标上,MAVIN 取得最佳结果。其中,镜头切换准确率 STA 达到 0.9897,对白时间对齐指标 TAMS 达到 0.8104,表明模型不仅能够生成连贯的音视频内容,也能更准确地执行脚本中的时间和身份约束。

五、从模型能力到创作接口:

MAVIN 拓展多镜头叙事的应用边界

当镜头边界、对白区间和角色身份被统一建模后,MAVIN 不再只是按照脚本一次性生成成片。创作者可以直接修改时间安排、角色设定和局部叙事条件,由此衍生出多种面向实际创作的应用。下面介绍其中两个具有代表性的应用场景:

叙事节奏控制(Speed Control)

通过调整镜头边界和对白区间,用户可以改变整段内容的叙事节奏。压缩镜头时长和对白区间,可以让画面推进与人物表达更加紧凑;延长相应区间,则能形成更舒缓的节奏。模型会按照新的时间安排重新组织动作、口型和声音,而不是简单地对已有视频进行机械变速。

角色身份定制(Identity Customization)

MAVIN 将角色的视觉外貌与声音身份作为可独立编辑的条件。用户可以分别替换参考图像或参考音频,实现同一人物使用不同音色说话,或让不同人物共享同一种音色。在保持故事、分镜和对白内容不变的情况下,创作者可以自由组合角色的外貌与声音,并在多次切镜和交替对白中维持正确的视听身份对应。

六、从「生成画面」到「组织叙事」

MAVIN 关注的不只是如何生成更清晰、更自然的单个镜头,而是让模型开始处理镜头、对白与角色视听身份之间的时空关系。视频生成的控制粒度,也由「画面中生成什么」进一步走向「内容在何时发生、由谁完成,以及如何跨越多个镜头展开」。

这种结构化的叙事控制,为多角色短剧、数字人表演、影视预演和交互式内容创作等场景提供了新的技术路径,也让音视频模型开始从单个片段生成,迈向更完整的叙事组织。

当模型不再只是完成一个画面,而能够沿着时间线组织并拍完一场戏,AI 视频才真正开始走向可控的叙事创作。

更多方法与实验细节,请参阅原论文及项目主页。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
独家对话孙宇晨:从“天价香蕉”到“天价彩礼”,他说这次真不是营销

独家对话孙宇晨:从“天价香蕉”到“天价彩礼”,他说这次真不是营销

凤凰网科技
2026-08-28 10:00:12
558人失联!运-20直插西藏震中,这一飞让全世界看清了中国真正的底牌

558人失联!运-20直插西藏震中,这一飞让全世界看清了中国真正的底牌

刘振起观点
2026-08-27 17:51:39
世预赛-中国男篮5人上双26分大胜卡塔尔 杨瀚森15+9胡明轩12分

世预赛-中国男篮5人上双26分大胜卡塔尔 杨瀚森15+9胡明轩12分

醉卧浮生
2026-08-28 01:43:54
赛中两度因雨暂停,次盘2-5落后的郑钦文,大雨后能救她吗?

赛中两度因雨暂停,次盘2-5落后的郑钦文,大雨后能救她吗?

网球之家
2026-08-28 14:28:26
日本驱逐舰沉没大半截!舱室大量进水!

日本驱逐舰沉没大半截!舱室大量进水!

烽火观天下
2026-08-28 12:53:21
张继科是个体面人

张继科是个体面人

张佳玮写字的地方
2026-08-28 12:21:32
认真评价:孙宇晨这15页香艳文学,到底写得好不好?(含细节)

认真评价:孙宇晨这15页香艳文学,到底写得好不好?(含细节)

热辣茉莉说
2026-08-28 11:53:58
延续黑马本色!常冰玉6-3奥沙利文,中国球手锁定武汉公开赛冠亚军

延续黑马本色!常冰玉6-3奥沙利文,中国球手锁定武汉公开赛冠亚军

全景体育V
2026-08-28 17:02:42
包养18岁女孩2年,国企高管嫌女孩存在坏他名声,2006年将女孩杀死

包养18岁女孩2年,国企高管嫌女孩存在坏他名声,2006年将女孩杀死

汉史趣闻
2026-08-27 17:56:02
企退人员档案核查开始!不是降养老金,重点就查5项,弄错真吃亏

企退人员档案核查开始!不是降养老金,重点就查5项,弄错真吃亏

白昼说故事
2026-08-27 11:28:31
景甜也是高段位大佬

景甜也是高段位大佬

贩财局
2026-08-28 13:40:30
尼泊尔山洪已致469人遇难,尼泊尔官员:技术团队已确认,导致洪水的冰川崩塌发生在本国境内

尼泊尔山洪已致469人遇难,尼泊尔官员:技术团队已确认,导致洪水的冰川崩塌发生在本国境内

中国网
2026-08-28 11:35:47
中国银行系统真实坏账水平有多严峻?

中国银行系统真实坏账水平有多严峻?

名人苟或
2026-08-27 07:04:22
女生高考结束后哭诉,抱怨父母拿不出5万块去旅游,网友回怼:你以后月薪6000能拿5000给爸妈吗?

女生高考结束后哭诉,抱怨父母拿不出5万块去旅游,网友回怼:你以后月薪6000能拿5000给爸妈吗?

捣蛋窝
2026-08-27 14:44:07
人设彻底翻车!景甜陷分手风波,网友评价难怪当年张继科拼命抽身

人设彻底翻车!景甜陷分手风波,网友评价难怪当年张继科拼命抽身

今夜繁星坠落
2026-08-28 15:06:51
“蛋烘糕婆婆被镜头霸凌”引争议,最新进展

“蛋烘糕婆婆被镜头霸凌”引争议,最新进展

澎湃新闻
2026-08-28 11:58:05
刘翔分钱的瓜爆了,震惊全网!

刘翔分钱的瓜爆了,震惊全网!

财经三分钟pro
2026-08-27 11:00:28
外媒披露尼泊尔山洪暴发原因:一块巨大冰体从冰川崩落,垂直落差超1000米

外媒披露尼泊尔山洪暴发原因:一块巨大冰体从冰川崩落,垂直落差超1000米

音乐时光的娱乐
2026-08-28 04:59:49
包贝尔涉事出轨女生曝光:五官精致身材好,她和包贝尔相识多年不是嫖娼

包贝尔涉事出轨女生曝光:五官精致身材好,她和包贝尔相识多年不是嫖娼

汉史趣闻
2026-08-27 16:28:50
东京飞吉隆坡客机起落架舱惊现腐尸:年轻男子死亡超72小时身份成谜

东京飞吉隆坡客机起落架舱惊现腐尸:年轻男子死亡超72小时身份成谜

扬子晚报
2026-08-28 17:33:34
2026-08-28 18:08:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13870文章数 142727关注度
往期回顾 全部

科技要闻

AI牛马永不下班!OpenAI让智能体自己找活

头条要闻

37岁工程师猝死未认定工伤 抢救期间手机仍收工作消息

头条要闻

37岁工程师猝死未认定工伤 抢救期间手机仍收工作消息

体育要闻

曼城花1个亿,买下了摩洛哥的“国民女婿”

娱乐要闻

景甜分手风波,网友:难怪张继科抽身

财经要闻

刑自强:AI投资下半场中国蓄势待发

汽车要闻

三大跨代技术 全新一代智己L6上市19.99万起

态度原创

时尚
游戏
家居
手机
健康

带火今年最热门的鞋,王菲合影秒变小迷妹,从不跟风的她为什么是爆款制造机?

短裙美少女爆杀丧尸!曝《电锯糖心》系列新作要来了

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

总有人问鸿蒙手机办公到底行不行?答案可能超出你预期

脑出血两大夺命风险,早治早保命!

无障碍浏览 进入关怀版