![]()
这项由南京大学NJU-LINK团队联合快手技术Kling团队、新加坡国立大学、北京邮电大学、伊利诺伊大学香槟分校以及西安交通大学共同完成的研究,以预印本形式发布于2026年7月,论文编号为arXiv:2607.24821v1,归属计算机多媒体领域(cs.MM)。对这项研究感兴趣的读者可以通过上述编号在arXiv平台检索完整论文。
你有没有遇到过这样的烦恼:想对一段视频做点修改,却发现改了画面之后声音完全对不上;或者把视频里的人物换了个造型,但背景音乐和环境音稀里糊涂地也跟着变了?这种尴尬,并不只困扰普通用户。即便是当今最先进的AI视频编辑系统,在处理"画面和声音需要协同修改"这件事上,也依然像个左手不知道右手在干什么的厨师——两只手各做各的,却很难保证端出来的菜看起来和尝起来都对。
这项研究正是瞄准了这个痛点。研究团队做了两件事:第一,他们建立了一套名为AVE-Compass的全面测试体系,专门用来衡量AI系统在"音画协同编辑"方面到底有多靠谱;第二,他们提出了一个叫做AVE-Agent的智能编辑助手框架,通过分步规划和自我反思来提升复杂编辑任务的完成质量。
要理解这项工作的价值,先得弄清楚现在的视频编辑AI面对的是什么样的挑战。
一、视频不只是会动的图片,声音才是灵魂的另一半
真实世界里的视频,是画面和声音紧密编织在一起的。一个人在雨中奔跑的视频,不只有画面中的雨滴和奔跑的身影,还有雨声、脚步声、可能的背景音乐,以及或许还有人物说话的声音。这四类声音各司其职,共同构成了你对这段视频的完整感受。
当你想用一句话告诉AI"帮我把晴天的街道改成暴风雨",这个指令背后隐藏着一系列连锁要求:画面要从阳光明媚变成乌云密布、大雨倾盆;对应的声音要从鸟鸣、车声变成雷声和雨声;而如果视频里有人在说话,那段对话和说话人的声音就不应该被动到;与此同时,原来街道上的其他视觉元素,比如行人、建筑物,也不应该莫名其妙消失或变形。
这种"修改一处、牵动多处"的关系,在专业术语里叫做"跨模态关联"——也就是画面改动和声音改动之间存在的内在逻辑联系。现有的AI工具几乎都是单打独斗的:专门做视频编辑的模型不懂得主动调整声音,专门做音频编辑的模型也不会根据画面内容来决定如何处理背景音乐。至于如何在改动某个元素的同时,保护好那些不该被动的内容,这更是一个长期没有被系统性解决的难题。
研究团队在调研现有的评测基准时发现,大多数视频编辑评测只盯着"画面有没有按要求改变",对声音的处理几乎视而不见;而少数涉及音频评测的系统,又往往只关注音频本身的质量,完全不管画面和声音是否还在步调一致地配合。这就好比考核一场舞台演出,裁判只看演员有没有背完台词,却从不关心灯光和音乐是否跟上了节奏。
二、AVE-Compass:一把专门测量"协同能力"的尺子
为了填补这个空白,研究团队花费大量精力建立了AVE-Compass这套评测体系。这把"尺子"的刻度非常精细,覆盖四个维度,并且用两种互补的方式来量度每个维度。
先说这套体系的"原材料"。研究团队从多个来源收集了145段精心挑选的源视频,这些视频覆盖了不同的拍摄场景、视觉风格、画面内容和声音类型,有室内室外、有单镜头多镜头、有真人拍摄也有AI生成。在此基础上,他们设计了196条编辑指令,这些指令覆盖28种细分操作类型,分属四大类别:只改视频画面的指令、只改音频的指令、需要同时改动视频和音频的联合指令,以及专门针对语音内容的指令。之所以要把"只改视频"和"只改音频"也纳入进来,是因为这两类任务恰好可以用来检验一个系统在做单侧改动时,会不会顺手破坏另一侧本该保持不变的内容。
每一条指令还被打上了多维度的"难度标签",标注了目标物体是否容易定位、声音场景是否复杂、以及画面和声音之间的关联程度有多深。这样一来,研究者就能知道:某个AI系统是在"简单题"上表现好,还是真正具备处理复杂场景的能力。
为了让评测更加细粒度,研究团队还为每条指令生成了2688条可以直接回答"是"或"否"的具体检查项。这些检查项经过了人工审核,确保每一条都精准、可验证,既不重复也不遗漏关键细节。
在评测方式上,AVE-Compass采用了两条并行的轨道。一条是"主观轨道",由多模态大语言模型(可以理解为一个同时看图、看视频、听音频的AI阅卷官)逐条回答那些检查项,并据此给出四个维度的分数。另一条是"客观轨道",用七种自动化指标从技术层面测量编辑结果的各项属性。这两条轨道各有侧重,合在一起才能给出全面而不失精准的评估。
那四个评测维度是这套体系的核心设计。第一个维度叫"指令执行度",衡量的是AI有没有真的按照要求完成了编辑动作。第二个维度叫"内容保真度",衡量的是AI在执行编辑时,有没有把本该保持不变的内容也一起改掉。第三个维度叫"真实感",衡量的是编辑后的视频看起来和听起来是否自然合理,有没有出现违背物理规律或视觉违和感的地方。第四个维度叫"编辑意图",这是前两个维度的综合——只有"执行了正确的编辑"且"没有破坏其他内容",才算真正完成了用户的意图。
七种自动化指标也各有分工。在画面和声音的同步性方面,有两种指标:一种专门检测口型和语音是否对齐,另一种检测声音事件和对应视觉事件之间的时间差。在视频画面质量方面,有三种指标分别测量视频的视觉美感、主体稳定性和运动流畅度。在音频质量方面,有一种指标评估整体音频的自然程度,另一种专门评估语音内容的清晰度和自然度。
三、六大系统的"大考":没有一个能轻松及格
建好了这把尺子,接下来就是拿来量一量现有AI系统的斤两。研究团队选取了五个代表性的系统参与对比测试:视频生成领域的Wan2.7、HappyHorse,以及谷歌的Gemini-Omni、字节跳动的Seedance,还有LTX2(即LTX-Video 2.3 Retake版本)。同时,研究团队自己提出的AVE-Agent也作为第六个参与者一同接受评测。
考试结果颇为值得回味。在最能反映"真正完成编辑"的"编辑意图"总分上,AVE-Agent以59.8分排名第一,其次是Wan2.7的42.4分和HappyHorse的41.3分,而Gemini-Omni只有38分,Seedance更是只有26.6分,LTX2则垫底,仅有15.2分。值得注意的是,满分是100分,也就是说即便是表现最好的系统,也只答对了不到六成。
深挖这些数字背后的故事,能发现三种截然不同的失败模式。
第一种失败叫做"懒惰型"——系统直接把原始视频原封不动地还给用户,什么都没改。Gemini-Omni和Seedance都有这个倾向,尤其是在音频方面。Gemini-Omni的音频响应率只有22%,也就是说它在大约78%的时间里,根本就没有对音频做任何修改。正因为如此,它的"音频内容保真度"得分高达96.1分——但这个高分是假象,因为你什么都没改,当然保存得完好无损。
第二种失败叫做"破坏型"——系统确实执行了编辑,但改的太猛,把本不该改的内容也一起掀翻了。LTX2是这种模式的典型。它在"指令执行度"上总分还不错(70.1分),但"内容保真度"只有可怜的30.6分,这意味着它在执行编辑时,大量破坏了本该保留的内容。研究团队用"重新合成"来描述这种行为——系统不是精细地修改目标区域,而是把整个视频或整段音频推倒重来,结果原来好好的内容就消失了。
第三种失败叫做"幻觉型"——系统不仅没完成要求的编辑,还脑洞大开地加入了用户根本没要求的东西。Gemini-Omni在这方面有典型案例:在一段要求改变碗中食物的视频里,它莫名其妙地在画面上添加了一个巨大的字幕;在另一个需要去除火车上乘务员的编辑任务里,它创造出了消失又出现的背景人物和无缘无故开着的车门,整个场景充满了逻辑混乱。
第二个规律是:当编辑任务变得更难时,大多数系统的表现会急剧下滑,而AVE-Agent下滑的幅度相对较小。具体来说,当视频时长从三五秒增加到九秒以上,多数基准系统的"编辑意图"分数大幅下降;当音源环境变得复杂(比如既有人声又有背景音乐又有环境音),很多系统的音频保真度急剧恶化;而当指令中隐含的"画面改了音频也要对应改"这种跨模态关联越深,大多数系统就越容易漏掉音频端的改动。
第三个规律是:自动化评分指标和主观判断之间的相关性普遍偏低。换句话说,一段视频在技术指标上看起来质量不错,但人类评审或AI阅卷官在看过之后,可能觉得它很不自然、很不合理。这个发现说明,仅仅用技术指标来衡量视频编辑质量是远远不够的,必须结合对"真实感"和"逻辑合理性"的主观评判。
四、AVE-Agent:把复杂任务拆成可执行的小步骤
既然发现了问题所在,研究团队也提出了自己的解决方案——AVE-Agent。这个系统的核心思路可以用"计划-执行-检验"三个词来概括,整体上像一个经验丰富的项目经理在指挥一个专业团队完成复杂任务。
AVE-Agent内部包含三个相互协作的模块。第一个叫规划器,负责理解用户的指令并做好全局规划。规划器会先仔细分析源视频,提取出场景信息、出现的人物和物体、正在发生的动作,以及视频里包含哪些声音。接着,它会识别出用户指令中明确说出来的要求,以及那些没有明说但逻辑上必须同步完成的隐含要求。例如,用户说"把那个人骑自行车的动作改成骑摩托车",规划器不仅会注意到视觉层面的改动,还会推断出:自行车的踩踏声应当改成摩托车引擎声,而视频里其他的背景声音应该保持不变。规划器会把所有这些要求拆分成一个个具体的子任务,并标注出它们之间的依赖顺序,形成一张"任务流程图"。每个子任务还会配套一份"验收标准",告诉后续的执行环节:完成到什么程度才算合格。最后,还有一个验证模块会检查这张流程图本身有没有矛盾或遗漏,如果有问题就触发重新规划。
第二个模块叫执行器,负责把每个子任务真正落实成具体的编辑操作。执行器拥有一套工具箱,里面有专门做视频画面编辑的工具、做音频分离的工具、做音频生成的工具,以及处理语音的工具。对于视频编辑子任务,执行器默认使用Wan2.7作为主力工具;对于音频处理,它会先用SAM Audio技术把不同的声音来源分离开来,再用MMAudio这个视觉条件音频生成系统来创建符合画面内容的新声音;对于语音相关的任务,则调用专门的语音克隆和口型同步工具。
执行器有一个重要特性:它不会盲目接受第一次尝试的结果。每完成一个子任务,执行器都会用规划器提供的验收标准来检验结果。如果检验不通过,它会分析哪里出了问题,针对性地修改操作指令,然后重新执行,最多尝试三次。整个过程中,系统始终保留迄今为止得分最高的版本,避免越改越糟。
第三个模块叫综合评估器,负责在所有子任务都完成之后,对组装好的完整视频做一次整体检查。单个子任务都通过验收,并不等于组合在一起也没问题——就好比每道菜单独尝起来都可以,但摆上桌之后口味却可能相互冲突。综合评估器会检查完整视频的指令执行情况、内容保真度和整体质量,然后根据发现的问题类型采取最低成本的修复措施:如果只是音量不对,就只做一次混音调整;如果某个音频子任务的结果有问题,就重新生成那一步;如果是整体规划层面出了问题,就把反馈传回规划器,触发全局重新规划。
从测试结果来看,AVE-Agent在"编辑意图"这个最核心的指标上比基础的Wan2.7提高了17.4分,在音频侧的指令执行度上提高了9.1分,在音画同步性上提高了0.073分。消融实验(也就是逐一去掉某个模块来测试它的贡献)显示,如果去掉规划器的提示词优化功能,"编辑意图"分数下降7.76分;如果去掉执行器的重试机制,分数下降8.75分。这说明两个模块都是不可或缺的。
五、评测体系本身的可信度如何?
一套评测工具,只有在它本身足够可靠的情况下,才能真正起到测量的作用。研究团队对AVE-Compass本身的可信度也做了认真的验证。
在稳定性方面,研究团队将完整的评测流程重复执行了五次,发现自动化指标的分数波动小于0.01,而AI阅卷官给出的分数波动小于1%,说明这套评测体系的结果非常稳定,不会因为每次运行的随机性而产生明显差异。
在与人类判断的一致性方面,研究团队从评测中抽取了一批题目,让人工标注员和AI阅卷官分别作答,然后对比二者的答案。结果显示,在"编辑意图"、"指令执行度"、"内容保真度"和"真实感"四个维度上,AI阅卷官与人类标注员的平均一致率接近90%。这意味着这套评测体系基本上能反映人类评审对编辑质量的真实判断,而不是AI在自说自话。
研究团队还专门分析了各项评测指标之间的相关性,发现主观评估指标和客观技术指标之间的相关性普遍偏弱,而客观技术指标内部之间的相关性有时候很强。这个发现印证了一个重要结论:在评测视频编辑质量时,技术指标和主观判断缺一不可,而且它们各自捕捉了不同侧面的信息,不存在哪个可以完全代替另一个的情况。
六、单一模态的编辑测试和错误类型分析
研究团队还专门测试了各个系统在"只改视频不改音频"和"只改音频不改视频"这两种单一模态编辑场景下的表现,并额外引入了"音频相似度"和"视频相似度"指标,直接衡量未被编辑的那一侧内容有没有被动手脚。
在只改视频的场景中,AVE-Agent和HappyHorse都能较好地做到"视频按要求改了,音频基本没动",而LTX2的音频相似度只有0.647,说明它在做视频编辑时,音频也被大幅改动了。在只改音频的场景中,AVE-Agent的视频相似度高达0.999,近乎完美地保留了原始画面,而LTX2的视频相似度只有0.924,说明它在做音频编辑时,视频画面也受到了波及。
研究团队还做了一个系统性的错误分类统计,将所有编辑结果按照失败类型划入五个桶:视频内容被破坏、音频内容被破坏、视频指令没执行、音频指令没执行,以及整体真实感较低。AVE-Agent在总错误数上最少,为175个,而Seedance有314个错误,LTX2高达406个。更关键的是,AVE-Agent的错误分布比较均衡,没有哪一种失败模式特别突出。相比之下,Gemini-Omni的音频指令未执行错误高达144个,占了它所有错误的很大一部分;LTX2的视频内容被破坏错误高达161个。这种对比清晰地呈现了不同系统各自的"软肋"所在。
说到底,这项研究揭示的问题比它给出的答案更有价值。当我们试图让AI帮我们"改一改这段视频"的时候,我们实际上是在要求它同时扮演摄像师、音效师和导演的角色——不仅要精准执行改动,还要保护好所有不该动的东西,还要保证画面和声音在改完之后依然像一对默契搭档。这件事的难度,远远超出大多数人的直觉预期。
当前最好的系统拿到满分100分的题,最高也只能答到60分左右,而且不同的系统会在截然不同的地方犯错——有的过于懒惰,有的过于冒进,有的会无中生有。这说明这个领域目前还处于早期阶段,既有清晰的方向感,又有巨大的提升空间。
对普通用户来说,这项研究意味着未来的视频编辑工具可能会越来越"聪明地克制"——不仅知道该改什么,更知道该保留什么,也知道改了一处之后另一处要跟着怎么动。对从事相关领域的研究者和工程师来说,AVE-Compass提供了一个远比以往更全面的测量工具,可以用来更准确地诊断自己的系统究竟在哪个环节还不够好。
如果你对其中的技术细节或实验数据感兴趣,可以通过arXiv编号2607.24821检索并阅读这篇完整论文,论文中还包含了详细的提示词模板、评测公式和案例分析,值得深入研读。
Q&A
Q1:AVE-Compass评测体系和普通视频编辑评测有什么区别?
A:普通视频编辑评测通常只关注画面有没有按要求改变,完全不管音频的处理情况。AVE-Compass则专门设计来衡量"画面和声音的协同编辑能力",不仅检测编辑是否执行,还检测未编辑的内容有没有被意外破坏,以及画面和声音在编辑后是否依然保持同步和逻辑一致。这是目前为止覆盖最全面的音画协同编辑评测体系。
Q2:AVE-Agent是如何避免"改了视频却把音频也改坏了"这个问题的?
A:AVE-Agent的规划器会在开始执行任何操作之前,先建立一份详细的"声音清单",明确列出哪些声音是要被修改的,哪些声音必须保持原样。在音频处理阶段,系统会用声音分离技术把不同来源的声音拆开处理,避免操作目标声音时影响到其他声音。每完成一步,专门的评估模块都会检查非目标声音有没有受到波及,如果有问题就触发修正。
Q3:Gemini-Omni的音频保真度得分很高,是不是说明它的音频保护能力很强?
A:恰恰相反。Gemini-Omni的高音频保真度分数是一个假象,源于它在大约78%的情况下根本没有对音频做任何修改。什么都没改,当然保存得完好无损。研究团队专门设计了"响应率门控"分析,将不作为的情况单独标记出来,去掉这些不作为的案例后重新计算,Gemini-Omni的音频保真度就会大幅下降。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.