网易首页 > 网易号 > 正文 申请入驻

不给VLM装耳朵,也能听懂视频里的话吗?

0
分享至

有件事你可能没想到。


现在市面上那些号称能"看又能听"的全能AI模型,比如通义千问的Omni系列,为了让模型听懂音频,工程师们干的第一件事是给一个已经很聪明的视觉语言模型,硬生生塞进去一个音频编码器,然后拉着整个模型重新做一遍海量的音频视频文本对齐训练。

这个过程有多贵?贵到什么程度呢,每次基础模型升级换代,这套音频适配的活儿都要从头再来一遍。而且更麻烦的是,这么折腾一圈之后,模型原本很强的看图能力、做题能力、甚至医学问答能力,反而可能变差了。

这就是这篇论文想戳破的一个假设:难道每出一个新的视觉语言模型,我们就非得重新给它做一次昂贵的"耳科手术"吗?

**一个反直觉的答案是,很多时候根本不需要。**

来自阿联酋穆罕默德·本·扎耶德人工智能大学的研究团队做了一件挺"偷懒"但很聪明的事:他们没有碰模型本身一根手指头,而是在外面挂了一个语音识别模块,把音频转成带时间戳的文字,直接塞进语言模型原本就有的文字输入接口里。这套方案叫TFO。

VLM*:视觉语言模型(Vision-Language Model),一种既能理解图片又能理解文字的AI模型,比如你熟悉的那些能看图说话的AI

ASR*:自动语音识别(Automatic Speech Recognition),就是把人说的话转成文字的技术

TFO*:Training-Free Omni,训练无关全模态框架,本文提出的核心方法,不改动模型任何参数就让它具备听觉能力

当年那些全能模型是怎么"武装"起来的

要理解TFO这个思路有多巧,得先明白原来的做法有多"重"。

市面上主流的全能模型,比如Qwen2.5-Omni、MiniCPM-O、OmniVinci,走的都是同一条路:找一个已经训练好的视觉语言模型当骨架,再单独训练一套专门处理音频的编码器和连接层,最后把这两拨东西拉到一起,用海量的音频加视频加文本数据做联合对齐训练。

这套流程听起来合理,问题出在哪呢?

音频这个东西天生就难伺候。它是时间上连续密集的信号,还经常夹杂噪音,你得让模型精确地把某一段声音和视频里某一帧画面对上号。之前已经有研究发现,哪怕是专门训练出来的音视频模型,也经常会漏听关键的声音信息,或者反过来,光靠画面脑补出根本不存在的声音。

更扎心的是第三个问题:模型在学新本事的过程中,可能会把老本事给忘了。

这不是危言耸听。论文里的实验数据很直接地摆出来了。以Qwen2.5系列为例,原始的Qwen2.5-VL在WorldSense这个需要视频理解的基准上,得分是39.7分,等它被训练成Qwen2.5-Omni之后,这个分数反而只有34.2分。视觉能力在音频训练的过程中被稀释了。

**这就好比你花大力气去学一门新外语,结果因为练习时间挤占了母语的使用,反而说起母语来磕磕巴巴了。**

如果外语学习机构告诉你"没关系,只要努力练,母语肯定不会退步",你大概率会怀疑这个说法。这篇论文做的事情,某种程度上就是把这种怀疑变成了可以量化验证的实验。

TFO到底怎么运作的

TFO的整体思路说白了没有那么玄乎。

系统接收到的输入可能是一段带声音的视频,也可能是图片加语音提问。第一步,用Whisper这个语音识别工具,把音频转写成文字。

Whisper*:OpenAI开发的一款开源语音识别模型,能把多种语言的语音转成文字,还能识别语言种类和给出转写的置信度

转写不是简单地把话变成字就完事了。Whisper会给出每一段话的起止时间戳,还会标注这段转写的可信程度。这里有个关键的过滤机制:置信度低于0.65的片段直接被扔掉,不会进入后续流程。为什么要这么干?因为背景噪音、静音、非人声的部分经常被语音识别工具强行"脑补"出一些莫名其妙的文字,如果不做过滤,这些幻觉文字反而会误导后面的推理。

带着时间戳和文字内容的转写结果,会被组装成一段文字,塞进原本视觉语言模型的输入提示词里,跟系统指令、视觉内容、用户问题拼在一起,一起喂给这个完全没有被改动过的模型。

**整个过程中,视觉语言模型的每一个参数都是冻结的,一个字节都没有动过。**

这里就要提一下时间戳的作用了。假设你在看一段足球比赛视频,有人问"传中球被头球攻门之后紧接着发生了什么"。如果只给模型一段没有时间标记的纯文字转写,模型很难知道"进球那句话"具体对应视频的哪个时间点。有了时间戳,模型就能把"00:03到00:07说了句什么"和视频画面里"00:03到00:07发生了什么"对上号,实现真正的时空对齐推理。

如果没有这个功能会怎样?论文的消融实验给出了答案:去掉时间戳之后,AVUT-Gemini这个基准掉了2.3分,Daily-Omni掉了1.4分。分数不是崩盘式下跌,但确实说明时间戳在需要精确对时的任务上是真金白银的贡献。

生成回答之后,如果需要语音输出,还可以再套一层CosyVoice3把文字转成语音,不过这一步纯粹是可选的收尾,不影响前面所有的评测结果。

大规模验证:56个基准,21种语言

光说思路巧妙没用,得看数据。

研究团队选了四个不同的模型家族做对照实验,每一对都是"原始视觉语言模型 vs 对应的原生全能模型 vs TFO改造版本"三方比较,覆盖Qwen2.5系列的3B和7B、MiniCPM4.5的9B、VILA对应的NVILA-8B,还有Qwen3系列的30B。总共跑了56个基准数据集,涉及21种语言的语音评测。

这个规模在同类研究里算是相当扎实的。

先看音视频理解这块,涉及九个基准,包括WorldSense、Video-Holmes、AVUT等。Qwen2.5-3B用了TFO之后平均分提升了3.0分,7B提升2.2分,VILA提升0.4分。特别值得一提的是WorldSense这个需要理解真实世界场景的基准,Qwen2.5-7B从33.9分直接跳到48.4分,涨了14.5分,这个幅度不算小。

不过MiniCPM4.5和Qwen3这两个家族在音视频理解上反而略降了2.2分和0.8分,说明这套方案不是万能药,效果确实跟具体模型和任务性质有关系。

再看纯音频理解,九个基准的平均分在全部五组对比里都提升了,涨幅分别是1.5、1.4、4.0、13.5和1.4分。VILA对应的OmniVinci提升最猛,从50.3分冲到63.8分。VoiceBench这个基准在VILA上直接从27.5分涨到78.0分,涨了整整51.3分。

这个数字是什么概念?

意味着原本的OmniVinci在语音指令跟随类任务上,答对率不到三成,换成TFO之后能对接近八成。这不是小修小补,是质变级别的提升。

多语言这块表现更亮眼。用CoVoST2这个覆盖21种语言的翻译测试集,五组对比全部提升,涨幅从6.8到18.4分不等。MiniCPM4.5家族涨幅最大,从45.6分到64.0分。具体到语言上,爱沙尼亚语涨了43.6分,拉脱维亚语涨了35.4分,瑞典语涨了35.8分。这些都是原生全能模型表现特别差的小语种,恰恰在这些语言上TFO的提升最明显。

**这个规律揭示了一件事:全能模型的多语言能力短板,很可能是因为音频训练数据里这些小语种样本太少造成的,而Whisper作为一个专门的语音识别工具,训练数据覆盖面本身就更广。**

冻结的代价与收益:那些被保留下来的能力

前面说的都是TFO在语音相关任务上的表现,但这篇论文更有意思的部分,其实是它证明了"冻结"这件事本身带来的好处。

图像和视频理解方面,八个图像基准和六个视频基准的对比里,TFO在图像上五组对比全部占优,涨幅从0.3到2.4分。视频理解上四组对比领先,涨幅2.3到3.8分。VideoMME这个长视频理解基准在四个模型家族里都涨了0.4到10.5分。

代码和数学推理方面,四组对比里三组TFO占优。有意思的是,每一个TFO版本在MBPP、MBPP Sanitized、HumanEval这三个编程基准上都稳定超过对应的原生全能模型。数学方面波动稍大,但视觉数学推理上进步比较明显,比如Qwen2.5-3B在MathVerse上从32.1分涨到47.6分,涨了15.5分。

医学问答这块覆盖了12个基准,五组对比全部提升,涨幅0.5到1.7分。MedFrameQA在Qwen3上涨了9.8分,PMC-VQA在MiniCPM4.5上涨了5.6分。

视觉定位(也就是模型精确指出图片里某个物体位置的能力)方面,PixMo-Count这个计数基准五组全部提升,VILA涨了15.5分,Qwen3涨了11.2分。

这些数字堆在一起说明了什么?

**说明原生全能模型在学习听觉能力的过程中,确实付出了看不见的隐性代价,而这个代价被冻结方案完整规避掉了。**

这里可以打个比方。假设你请了一位家教,专门给孩子补数学,结果家教用力过猛,占用了孩子太多语文练习时间,期末考试数学是提高了,语文却退步了。而TFO相当于换了个思路:完全不动孩子原本的学习安排,只是额外给他配了个"实时翻译耳机",专门帮他听懂课堂上的语音内容,其他所有课程该怎么学还怎么学。

如果家长不做这个权衡,只盯着数学分数提升就沾沾自喜,语文退步的问题很容易被忽略。这篇论文的价值恰恰在于,它把这两笔账都摆出来对比着算,而不是只报喜不报忧。

TFO撞到的两堵墙

任何方案都有边界,TFO也不例外,论文对此说得很坦诚。

第一堵墙是速度。因为需要先跑一遍语音识别再跑视觉语言模型,两步是串行的,总耗时自然比原生全能模型一次到位要慢。以AVMeme这个基准为例,原生模型总耗时大概0.7到2.4秒,TFO则要1.3到3.1秒。不过如果同一段音视频要回答多个问题,转写结果可以只做一次然后反复用,这个额外开销就能被摊薄。

第二堵墙更本质,是转写这个环节天生的信息损失。

研究团队专门用AVHBench这个基准做了细分实验,把任务拆成三类。第一类叫"音视频匹配",看模型能不能判断听到的声音和看到的画面是不是对得上;第二类叫"视频驱动的音频幻觉",看模型会不会因为画面暗示了某种声音,就误以为真的听到了这个声音;第三类叫"音频驱动的视频幻觉",反过来,看模型会不会因为听到某种声音,就误以为画面里真的出现了对应的物体。

结果很清楚。前两类涉及非语音的声学信息,比如音乐、环境音、情绪语调,这些东西一旦被压缩成纯文字转写,细节就丢了,TFO在这两类任务上普遍表现不如原生全能模型,甚至有明显退步。但在第三类任务上,因为TFO压根没动过视觉通路,反而在四个模型家族里全部超过原生模型。

**这个界线划得非常干净:语言层面的路由能搞定"听懂说了什么",但搞不定"听懂这是什么声音"。**

研究团队没有就此止步,还试着补救过。他们额外接了几个专门处理音频的辅助模型,比如SenseVoice负责识别情绪和声音事件,MELLOW负责推理声学场景,AudioFlamingo2负责描述长音频,把这些模型输出的文字描述也一并塞进提示词。结果发现,这些辅助信息经常在某个基准上有点小提升,换个基准立马又拖后腿,没有哪个组合是稳定管用的。

这说明什么?说明想把丰富的声学信息塞进纯文字接口,本身就是个不太靠谱的路子,声音里那些非语言的信息,恐怕真的需要更贴合它本质的表示方式,而不是硬翻译成一串描述性文字。

这就好比你想向一个从没见过颜色的人描述"晚霞的橙红色有多美",你可以写很长的文字去形容,但这些文字终究替代不了直接看一眼。语言这个媒介本身,在传递某些感官信息时是有损耗的。

消融实验揭示的分工

论文里还做了个挺清晰的拆解实验,专门验证TFO里每个部件各自贡献了什么。

用Qwen2.5-VL-3B当底座,测试四种配置:原始视觉语言模型不加任何音频信息、加上Whisper转写、加Whisper但去掉时间戳、以及原生的Qwen2.5-Omni做对照。

结果显示,光是原始视觉语言模型,在WorldSense和Video-Holmes上就已经超过了原生全能模型,说明视觉推理能力本身没问题。加上Whisper之后,六个基准全线提升,五个超过了原生Omni模型。去掉时间戳,AVUT-Gemini掉2.3分,AVMeme-Full掉1.7分,Daily-Omni掉1.4分。

这个实验的价值在于把功劳拆分清楚了:视觉能力是原本骨架自带的,听懂说了什么靠的是Whisper,而精确对齐时间点则要靠时间戳这个额外设计。三个部分各司其职,谁也替代不了谁。

写在后面

读完这篇论文,我脑子里一直在打转的一个问题是:我们是不是习惯性地把"加能力"等同于"加训练"了?

在深度学习这几年的叙事里,几乎所有的进步故事都长得差不多:想让模型多会点什么,就去找更多数据、设计更复杂的结构、投入更多算力去训练。这套叙事太顺理成章了,以至于我们很少停下来问,有没有可能某个能力根本不需要被"塞"进模型内部,而是可以在外部拼接完成。

TFO这篇论文让我意外的地方,其实不是它的准确率数字有多漂亮,而是它选择了一条几乎"反工程直觉"的路:明明有现成的技术能做联合训练,却故意不这么做,转而去验证"不训练"到底能撑到什么程度。这种做减法的研究思路,在一个普遍追求"更大更强更复杂"的领域里,显得有点特立独行。

还有一个细节让我印象很深,就是那个关于置信度阈值0.65的选择。研究者试了0.6和0.75两个数值,发现0.6和0.65效果差不多,但0.75反而因为过滤太严格,把一些有用但语音识别不太确定的内容也一起扔掉了,导致AV-Odyssey这类任务分数下降。这个细节说明,看似简单的一个超参数,背后其实也是一场"宁可漏检还是宁可误判"的权衡博弈,没有什么绝对正确的答案。

这篇论文没有解决的问题也很明显:非语音的声学信息,比如音乐的情绪、环境音的层次感,这些东西怎么才能不经过文字这个"瓶颈",直接被语言模型理解?如果哪天有人找到一种方法,能让声音的"质感"绕过转写直接进入模型的推理过程,会不会又是另一个值得写的故事?

Q&A

Q1:TFO是什么?

A:TFO全称Training-Free Omni,是穆罕默德·本·扎耶德人工智能大学团队提出的一种方法,不需要改动或重新训练视觉语言模型,只靠外挂语音识别工具把音频转成带时间戳的文字,就能让模型具备听觉理解能力。

Q2:TFO和原生全能模型相比效果怎么样?

A:在56个基准、21种语言的测试中,TFO在纯音频理解和多语言语音任务上全面超过原生全能模型,同时更好地保留了原模型的图像视频理解、代码数学推理和医学问答能力,但在音乐、环境音等非语音声学理解上表现较弱。

Q3:TFO有什么局限性?

A:主要有两点,一是因为语音识别和模型推理是串行执行,整体耗时比原生模型略长;二是把声音转成文字会丢失情绪、音乐、环境音等非语言信息,导致这类任务表现不如经过专门训练的原生全能模型。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
被逮捕的4位央视主持人,个个都沦落到阶下囚,最严重的出卖国家

被逮捕的4位央视主持人,个个都沦落到阶下囚,最严重的出卖国家

阿坹武器装备科普
2026-09-29 18:14:17
沉默45年,中国终于迎来第二轮“严打”!目标改变总体战正式打响

沉默45年,中国终于迎来第二轮“严打”!目标改变总体战正式打响

闻识
2026-05-04 08:59:03
1439天,苹果最长迭代产品即将上新了

1439天,苹果最长迭代产品即将上新了

放毒
2026-09-28 18:23:32
C罗的含金量上升?西班牙40场不败+4进决赛夺3冠,唯独输给葡萄牙

C罗的含金量上升?西班牙40场不败+4进决赛夺3冠,唯独输给葡萄牙

球场没跑道
2026-09-30 07:26:11
霍尔木兹海峡突然静了:伊朗只提一个条件,美国为啥死活不接

霍尔木兹海峡突然静了:伊朗只提一个条件,美国为啥死活不接

纪史行者
2026-09-30 09:07:04
老胡为何总在师德问题上玩双标逻辑

老胡为何总在师德问题上玩双标逻辑

小眼睛小世界
2026-09-30 04:17:53
看了韩国街拍才发现:今年秋天“棕色系”太火了,鞋包这样搭更有氛围

看了韩国街拍才发现:今年秋天“棕色系”太火了,鞋包这样搭更有氛围

小陈聊搭配
2026-09-30 21:21:20
俄军单日伤亡破2千人创历史新高!“下水道”战术被乌军识破

俄军单日伤亡破2千人创历史新高!“下水道”战术被乌军识破

项鹏飞
2026-09-30 19:38:08
可怕!拜登政府从阿富汗接来的“难民”,40%审查错误,多名恐怖分子混入其中

可怕!拜登政府从阿富汗接来的“难民”,40%审查错误,多名恐怖分子混入其中

大洛杉矶LA
2026-09-30 04:34:07
孙怡获平遥电影节最佳女演员,上台发言激动落泪,前夫董子健台下鼓掌

孙怡获平遥电影节最佳女演员,上台发言激动落泪,前夫董子健台下鼓掌

韩小娱
2026-09-30 10:04:21
演员查德·洛13岁女儿去世,家属发声明

演员查德·洛13岁女儿去世,家属发声明

自愈小日子
2026-09-30 11:54:29
好卑微!东航通报“空姐下跪”道歉事件:情况属实,空姐返岗进行心理疏导,大批网友发声,并不买账

好卑微!东航通报“空姐下跪”道歉事件:情况属实,空姐返岗进行心理疏导,大批网友发声,并不买账

李晚书
2026-09-30 17:56:54
性与命和寿的关系:好命长寿的男人,往往身上有这三种特征

性与命和寿的关系:好命长寿的男人,往往身上有这三种特征

新时代的两性情感
2026-09-22 13:26:25
黄仁勋回应“AI模型蒸馏即盗窃”争议;曝华为Mate 90系列全系支持eSIM,预计支持四卡双待;OpenAI推出全天候自主智能体Dots | 极客头条

黄仁勋回应“AI模型蒸馏即盗窃”争议;曝华为Mate 90系列全系支持eSIM,预计支持四卡双待;OpenAI推出全天候自主智能体Dots | 极客头条

CSDN
2026-09-30 10:18:50
河南裕隆金属材料有限公司原董事长陈庆云接受审查调查

河南裕隆金属材料有限公司原董事长陈庆云接受审查调查

界面新闻
2026-09-30 08:38:12
简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

步论天下事
2026-09-07 09:40:52
“听到尖叫声,一名飞行员遭刺伤,有血迹”,乘客透露迪拜航空客机事故细节;以高官:迹象表明,副驾驶试图夺取飞机控制权并使其坠毁

“听到尖叫声,一名飞行员遭刺伤,有血迹”,乘客透露迪拜航空客机事故细节;以高官:迹象表明,副驾驶试图夺取飞机控制权并使其坠毁

南方都市报
2026-09-30 17:47:06
爷爷带娃半小时,妈妈换尿不湿发现女儿下面流血,崩溃直冲医院,医生:不用治,回家吧!

爷爷带娃半小时,妈妈换尿不湿发现女儿下面流血,崩溃直冲医院,医生:不用治,回家吧!

菁妈育儿
2026-09-22 07:59:21
浓眉:以我们的人员和天赋 我们应该成为联盟前十的防守球队

浓眉:以我们的人员和天赋 我们应该成为联盟前十的防守球队

北青网-北京青年报
2026-09-30 20:30:03
中央气象台:今晚到明晚,湖南、江西、浙江、福建、重庆、云南、广西、广东、海南岛等地将有短时强降水,四川、贵州等地有雷暴大风

中央气象台:今晚到明晚,湖南、江西、浙江、福建、重庆、云南、广西、广东、海南岛等地将有短时强降水,四川、贵州等地有雷暴大风

大风新闻
2026-09-30 18:08:15
2026-09-30 22:59:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
10022文章数 569关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

伊朗总统乘老旧专机"闯进敌营" 强硬回应特朗普的威胁

头条要闻

伊朗总统乘老旧专机"闯进敌营" 强硬回应特朗普的威胁

体育要闻

30天30队·火箭:乌度卡的控制欲

娱乐要闻

胡歌现身游本昌遗体告别仪式

财经要闻

“杭州六小龙”迎来价值重估

汽车要闻

燃油车的最佳平替 长城大狗HEV简单好开更经济

态度原创

教育
本地
家居
数码
公开课

教育要闻

ADHD孩子上小学很吃力?这5件事,家长一定要知道

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

Marshall发布Bromley 150派对音箱:售价3999元

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版