网易首页 > 网易号 > 正文 申请入驻

AI剪辑一分钟以上、有好几个镜头切换的长视频效果如何?

0
分享至


先说一个可能会让你意外的事实:现在市面上那些号称最先进的视频编辑模型,比如Seedance 2.0、Kling o3这些闭源顶流,一旦碰到超过一分钟、有多个镜头切换、还带着好几条编辑指令的长视频,表现会集体崩盘。不是效果差一点,是那种"改了半天连要改的东西都没改对"的崩盘。

这事听起来有点反直觉。毕竟这些模型在十几秒的单镜头短视频上已经很强了,加个滤镜、换个衣服颜色,毫无压力。可一旦视频变长、镜头一多,事情就完全不一样了。南开大学和腾讯的一个研究团队把这个问题系统地摆了出来,还专门造了一个新词来描述它:多指令多镜头长视频编辑,英文缩写MMLVE。

这篇论文做的事情,说白了就是回答一个问题:为什么现有的AI编辑不了长视频,以及怎么才能编辑好。

**核心问题出在哪**

想象你有一段一分钟的视频,里面出现了三个镜头:第一个镜头是个老工匠在做手工艺品,第二个镜头是一个骷髅模型摆在桌上,第三个镜头是个士兵走过。你给AI下了三条指令:把老工匠的蓝衬衫换成红衬衫,给骷髅戴个海盗帽,把那个士兵从视频里删掉。

现在最常见的处理方式是什么?把这一分钟视频切成四段十五秒的小片段,然后把这三条指令原封不动地扔给每一段去执行。

这里麻烦就来了。

骷髅模型可能只出现在第二段里,但AI editor拿到"给骷髅戴帽子"这条指令后,如果第一段视频根本没有骷髅,它很可能会凭空生成一个骷髅出来,然后给它戴帽子。这就是论文里说的编辑幻觉问题:本来不该出现的东西,因为指令的存在被硬凑出来了。

如果你在家里请人装修,只跟一个瓦工说"把厨房的墙刷成蓝色",结果这个瓦工听完转头把客厅、卧室、阳台的墙全刷成了蓝色,因为他没搞清楚这句话只适用于厨房这一个空间。这就是当前AI编辑模型犯的错,它们没有能力去判断一条指令只该在某个特定的镜头里生效,而是把所有指令一股脑地套用到所有片段上,结果哪里都出问题。

除了幻觉问题,还有另外两个更棘手的麻烦。一个是跨镜头一致性问题:如果老工匠这个人物在第一个镜头出现,改了衣服颜色,那么等他在后面第三个镜头再次出现时,衣服颜色还是不是红色的?现有模型往往是把每个片段独立处理,压根不知道这两个片段里其实是同一个人,于是改到第三个片段时,又把衣服颜色改回原样了,或者干脆改成了完全不同的颜色。

另一个是时空结构破坏问题:这种"一刀切"的分段方式,很可能会把原本连续的镜头强行打乱顺序,或者破坏掉背景、摄像机运动这些本来不需要改动的东西,导致画面出现闪烁、跳帧,甚至剧情顺序都乱套了。

论文把这三个问题正式定义成了三个衡量标准。第一个叫**跨镜头编辑一致性**,简称CSEC,要求被编辑的实体在不同镜头里始终保持一致的外观。第二个叫**多指令解耦**,简称MID,要求多条指令互不干扰,各归各位,不能张冠李戴。第三个叫**时空结构零破坏**,简称ZDSS,要求没被要求改动的部分,包括背景和运动轨迹,一点都不能乱动。

这三个词听起来有点绕,其实归纳起来就一句话:改该改的,别的都别碰,改完了还要前后一致。

**解法:先想清楚,再动手**

论文起的框架名字叫MMLVE-Agent,核心思路可以用一句话概括:从"盲目切块"转向"先思考镜头再动手"。

这套系统由大语言模型和视觉语言模型协同工作,构成一个多智能体架构。

大语言模型*:擅长理解和处理文字,比如把用户那段又长又复杂的中文指令拆解成一条条独立、清晰的编辑任务。

视觉语言模型*:能同时看懂图片和文字,比如判断视频某一帧里到底出现了哪个角色、这个角色符不符合用户描述的特征。

整个流程分成三个阶段。

第一阶段叫指令与视频分析。系统先用一个叫PyDetect的工具做物理镜头检测,把长视频按真实的镜头切换点切开,而不是按固定的十五秒去硬切。这个区别很关键:按真实镜头切,才能保证一个完整的场景不会被砍成两半。同时,大语言模型负责把用户的复杂指令拆解成独立的编辑任务,明确每条指令该配哪个实体、该在哪个时间段生效。视觉语言模型则会给每个镜头提取关键帧,分析场景里都发生了什么。

第二阶段是这套系统里最巧妙的设计,叫全局记忆卡。

这个设计要解决的问题是跨镜头一致性。系统先在所有镜头里,用视觉语言模型去检索出现目标实体的关键帧,挑出置信度最高的六张拼成一张参考图,再用图像生成模型合成一张这个实体"原本长什么样"的标准照。接着按照用户的编辑指令,把这张标准照编辑成"改完之后长什么样"的样子。这两张照片一左一右拼在一起,就成了所谓的全局记忆卡,相当于给后续的视频编辑器一个统一的视觉参照物。

这就好比拍电影时的连续性检查员。片场里同一个演员今天穿蓝衬衫拍了一个镜头,三天后补拍另一个镜头时,如果没有人拿着照片提醒场务"上次这里衣服是这样系的,头发是这样梳的",补拍出来的画面很可能对不上。全局记忆卡干的正是这个活,它把"这个实体改之前和改之后分别长什么样"钉死在一张参考图上,不管后面视频编辑器处理多少个镜头,都拿同一张图对齐,不会出现"改到第三个镜头衣服颜色又变了"的情况。如果没有这张卡,每个镜头就是各编各的,互相不知道对方的存在,一致性根本无从谈起。

生成这张标准照的过程本身也不是一次成型,论文引入了一个叫**正负反馈编辑**的机制,简称P-NEF。

视觉语言模型会充当一个评估者的角色,检查生成的参考图是否真的匹配关键帧。如果不匹配,它不只是告诉生成模型"这里错了",同时还会告诉它"这里是对的,继续保持"。前者叫负向提示,后者叫正向提示。

为什么要专门加这个正向提示?论文里做了个很直观的对比实验。如果只用负向反馈,就是不断地告诉模型"别这样、别那样",随着重试次数增加,避免事项越堆越多,模型的注意力会不自觉地全部扑到这些"禁止清单"上,反而忘了原本已经改对的地方,结果是越改越乱,把本来正确的细节也改坏了。

这就像老师批改作文,如果只是不停地在错的地方画红圈,学生下一次写作文时脑子里全是"这里不能这样写、那里不能那样写",反而写不出流畅的内容,因为注意力全被负面清单占据了。如果同时告诉他"这一段写得好,继续保持这个风格",他才能在改正错误的同时不丢掉原本的优点。P-NEF的正向提示就是这个"表扬"的部分,它让模型在修正问题的同时,记住哪些地方已经做对了,不要动。

第三阶段是真正执行视频编辑的环节。这里用到一个叫**检索式按需编辑**的策略:对每个镜头,视觉语言模型会做三次投票判断,这个镜头里到底有没有出现目标实体。只有拿到至少两票"有",编辑操作才会真正触发;如果票数不够,这个镜头就原样保留,不做任何改动。

这个投票机制解决的正是开头提到的幻觉问题。如果没有这道检索关卡,"给骷髅戴帽子"这条指令就会不分场合地砸向每一个镜头,逼着模型在没有骷髅的画面里硬凑一个骷髅出来。有了这道关卡,系统会先确认"这个镜头里到底有没有骷髅",没有就跳过,绝不强行执行。

对确实需要编辑的镜头,系统会用一个叫HappyHorse的视频编辑模型来执行实际改动,同时再套用一层视频级别的P-NEF反馈循环,检查两件事:编辑任务是不是真的完成了,没被要求改动的背景和运动是不是原封不动地保留下来了。改完之后,把编辑过的镜头和跳过的原始镜头重新拼接起来,就是最终的成品视频。

**用什么衡量效果**

光有方法不够,得有靶子可以打。研究团队专门造了一个评测数据集,叫MMLVE-Bench,从一个开源的视频理解数据集UniVA-Bench里精选了25个高质量的一分钟左右多镜头长视频,每段视频配上大约五条真实且复杂的编辑指令,先由AI生成候选指令,再由人工核查修正,确保逻辑通顺、描述准确。

评测标准也没有走传统路线。像CLIP分数、PSNR这类经典的图像质量打分方式,压根没有能力去理解"这条指令是不是套用到了错误的镜头"这种语义层面的问题,所以论文干脆用视觉语言模型本身来当裁判,针对CSEC、MID、ZDSS这三个核心指标,每个又细分成五个子维度,每个子维度按0、10、20三档打分,满分一百。

结果摆出来相当直接。

| 方法 | CSEC | MID | ZDSS | 平均分 |

| Seedance 2.0 | 77.58 | 78.58 | **82.25** | 79.47 |

| Kling o3 | 70.00 | 72.57 | 69.13 | 70.57 |

| HappyHorse 1.0 | 74.68 | 67.28 | 66.88 | 69.61 |

| MMLVE-Agent(本文方法) | **84.80** | **79.04** | 81.68 | **81.84** |

有个细节很有意思。Seedance 2.0在ZDSS这一项拿了最高分,但这并不代表它做得最好,而是因为它在面对复杂场景时会采取一种保守策略,遇到难改的指令直接放弃不改,这样自然不会破坏画面结构,但代价是大量指令根本没被执行,CSEC和MID的分数因此偏低。MMLVE-Agent则是老老实实把该改的都改了,ZDSS分数略有下降,但换来的是全面且真实的编辑执行。

论文还专门找了9名有视频生成和视觉内容评估经验的专家做人工评测,每人随机分到5个案例进行盲测排序。结果MMLVE-Agent在75.6%的案例中排名第一,在93.3%的案例中排进前二,平均排名1.36,远超其他三个基线方法的2.63到3.16。和Seedance 2.0、Kling o3、HappyHorse三个方法两两对比时,胜率分别达到88.4%、80.5%和93.3%,统计检验也确认了这个差距不是偶然。

论文里还有个很生动的对比案例。同一段视频要求把一个时钟的形状改成方形、颜色改成红色,同时删掉一个坐在椅子上的年轻男子,再给骷髅模型戴上棒球帽。Seedance 2.0成功改了时钟颜色但没改形状,完全没删掉那个男子,也漏掉了给骷髅戴帽子这个操作。Kling o3更离谱,时钟形状忽变忽不变,还把那个本该被删除的男子错误地"移植"到了另一个完全不相关的镜头里。HappyHorse 1.0则是把时钟给一起删了,后面几个镜头的顺序还整个乱套了。只有MMLVE-Agent把三条指令都在各自对应的镜头里精准落地,没有波及不该动的地方。

**写在后面**

读完这篇论文,有个细节让我一直在想:为什么这些顶级闭源模型在短视频上表现那么好,一到长视频就集体失灵?答案其实藏在论文对Seedance 2.0"保守策略"的描述里。这类模型面对复杂指令时会本能地选择少做、不做,宁可漏改也不乱改,这其实暴露了一个更深的问题:这些模型压根没有"理解视频结构"这一层能力,它们只是在按帧或者按固定时长处理画面,根本不知道镜头和镜头之间存在着叙事上的连续性。

这让我联想到早期机器翻译的困境。逐词翻译永远翻不出通顺的句子,因为语言的意义是建立在上下文和篇章结构上的,不是孤立的词能承载的。视频编辑现在正处在类似的阶段,如果模型不理解"这是一个镜头,那是另一个镜头,它们讲的是同一件事的不同片段",就永远只能在局部打转,做不出真正连贯的长视频编辑。

论文里那个正负反馈机制的设计也值得多想一层。它其实揭示了一个更普遍的现象:单纯的负反馈会让系统陷入局部震荡,不断修正一个错误的同时制造新的错误。这个现象在很多需要迭代优化的系统里都能看到,不只是AI视频编辑。

这篇论文没有回答的问题是,当视频长度继续增加,比如到十分钟、一小时,镜头数量成倍增长时,这套基于检索和投票的机制还能不能撑住。毕竟现在的测试集只是一分钟左右的视频,投票和检索的计算成本会不会随着镜头数量线性甚至更快地增长,这个问题留在了论文之外。

Q&A

Q1:MMLVE任务是什么?

A:MMLVE指的是多指令多镜头长视频编辑任务,要求AI在处理一分钟以上、包含多个镜头切换的长视频时,同时执行多条不同类型的编辑指令,还要保证跨镜头一致性、指令互不干扰、不破坏原有画面结构。

Q2:MMLVE-Agent和现有视频编辑模型比有什么不同?

A:现有模型比如Seedance 2.0大多采用固定时长切块的方式处理长视频,容易产生编辑幻觉和身份不一致问题。MMLVE-Agent通过物理镜头检测、全局记忆卡和正负反馈机制,先理解视频结构再针对性编辑,避免了盲目切块带来的各种问题。

Q3:全局记忆卡是怎么保证跨镜头一致性的?

A:全局记忆卡是一张"改前改后"对比图,系统先从所有镜头里检索出目标实体的关键帧生成标准参考图,再按指令编辑出改后的样子,后续所有镜头的编辑都参照这张卡进行,从而保证同一实体在不同镜头里外观统一。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
震惊!快一周了,终于知道威胁空姐下跪的男乘客姓什么,原来是欧先生,还是个博士,舆论一片哗然

震惊!快一周了,终于知道威胁空姐下跪的男乘客姓什么,原来是欧先生,还是个博士,舆论一片哗然

火山詩话
2026-10-04 05:22:10
中网再爆大冷门!萨巴伦卡遭20岁新星横扫,前2号种子均已遭淘汰

中网再爆大冷门!萨巴伦卡遭20岁新星横扫,前2号种子均已遭淘汰

全景体育V
2026-10-04 12:51:13
高速堵车彻底终结?广东一招“反向操作”火遍全国

高速堵车彻底终结?广东一招“反向操作”火遍全国

生活魔术专家
2026-10-04 09:53:33
英国的天才叫牛顿,德国的天才叫爱因斯坦,那中国的天才叫什么?

英国的天才叫牛顿,德国的天才叫爱因斯坦,那中国的天才叫什么?

抽象派大师
2026-10-02 04:01:58
记者:拉塞尔是超级盲盒 球权集中在他手上会变成靠天吃饭孤掌难鸣

记者:拉塞尔是超级盲盒 球权集中在他手上会变成靠天吃饭孤掌难鸣

狼叔评论
2026-10-04 14:52:14
宁愿不参加APEC,高市早苗也没收回那句话,访华付出再多也是徒劳

宁愿不参加APEC,高市早苗也没收回那句话,访华付出再多也是徒劳

墨兰史书
2026-10-03 15:40:13
一家三口出车祸,唯独后排77岁的母亲受重伤!医生:不少人存在认知误区,这个细节别忽视

一家三口出车祸,唯独后排77岁的母亲受重伤!医生:不少人存在认知误区,这个细节别忽视

都市快报橙柿互动
2026-10-04 00:41:34
菲军在中业岛吃饭要提前48小时向中方报备,这比军舰对峙更扎心

菲军在中业岛吃饭要提前48小时向中方报备,这比军舰对峙更扎心

浯江孤舟
2026-10-03 10:39:39
6场比赛仅首发1次!国足中场天才之星惨遭安东尼奥冷落,沦为亚运鸡肋

6场比赛仅首发1次!国足中场天才之星惨遭安东尼奥冷落,沦为亚运鸡肋

零度眼看球
2026-10-04 08:46:39
医生提醒:老年人4件事上太勤快,并不是好事,可能会招来疾病

医生提醒:老年人4件事上太勤快,并不是好事,可能会招来疾病

袁医生课堂
2026-09-20 08:07:09
杭州大扫H后,商k女会去哪了?

杭州大扫H后,商k女会去哪了?

新动察
2026-10-04 13:42:49
31岁的阎锡山,娶了14岁的小妾,洞房之夜,阎锡山对小妾说:“你躺下吧,你只负责传宗接代,我不会喜欢你的,我只爱我的原配夫人!”

31岁的阎锡山,娶了14岁的小妾,洞房之夜,阎锡山对小妾说:“你躺下吧,你只负责传宗接代,我不会喜欢你的,我只爱我的原配夫人!”

回京历史梦
2026-10-04 04:45:05
第四轮投票落定!中国干脆一不做二不休,把一票否决,堵在美心口

第四轮投票落定!中国干脆一不做二不休,把一票否决,堵在美心口

凡知
2026-10-03 14:24:48
煮熟也有毒,赶紧扔掉!很多家庭天天在吃,别再舍不得扔掉

煮熟也有毒,赶紧扔掉!很多家庭天天在吃,别再舍不得扔掉

新时代的两性情感
2026-09-12 19:52:44
10月4日,国庆假期过半,养老金调整却迎来了新消息,来看看

10月4日,国庆假期过半,养老金调整却迎来了新消息,来看看

社保小达人
2026-10-04 10:31:58
央视揭露:“明厨亮灶”餐厅镜头却对着地面,实地探访有老鼠,老板称“做餐饮百分之百有四害”

央视揭露:“明厨亮灶”餐厅镜头却对着地面,实地探访有老鼠,老板称“做餐饮百分之百有四害”

上观新闻
2026-10-04 14:49:16
杨兰兰又没来!法官警告成废纸

杨兰兰又没来!法官警告成废纸

吃瓜体
2026-10-03 10:57:14
田馥甄亲手毁掉了自己的演艺生涯,如今发新专辑,无任何线下宣传

田馥甄亲手毁掉了自己的演艺生涯,如今发新专辑,无任何线下宣传

芊手若
2026-10-04 11:02:09
我娶了俄罗斯退役女兵,一个月50次夫妻生活,她却从不提家里人,岳父病危时我塞给她24万,直到10年后我去银行贷款,柜员一句话让我当场愣住

我娶了俄罗斯退役女兵,一个月50次夫妻生活,她却从不提家里人,岳父病危时我塞给她24万,直到10年后我去银行贷款,柜员一句话让我当场愣住

故事情感屋
2026-10-03 15:54:33
拿斧头砍机长的副驾驶身份披露,发了3000条“仇女”消息

拿斧头砍机长的副驾驶身份披露,发了3000条“仇女”消息

中国新闻周刊
2026-10-04 11:40:23
2026-10-04 16:28:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
10040文章数 569关注度
往期回顾 全部

科技要闻

苹果确认:iPhone 18 Pro Max有问题

头条要闻

25岁女子在马来西亚遭安保闯入房间性侵未遂 后续来了

头条要闻

25岁女子在马来西亚遭安保闯入房间性侵未遂 后续来了

体育要闻

“小将”吴曦,中国的莫德里奇

娱乐要闻

杨议没料到,郭德纲如今仍是一呼百应

财经要闻

OpenAI前安全部门员工:公司文化已崩坏

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

教育
时尚
艺术
游戏
本地

教育要闻

欢迎报考!华师2027年硕士研究生招生简章发布

伊姐十一热推:电视剧《余红旧事》;电视剧《不是你的恋爱》......

艺术要闻

沙特要盖2000米高楼,一年维护费达8亿美元!

又一款T2旗下大作移除D加密 发售仅一年多

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

无障碍浏览 进入关怀版