网易首页 > 网易号 > 正文 申请入驻

大模型听懂语音却变笨?港中深与微软联合解决语音大模型降智问题

0
分享至

从 GPT-4o 开启全能(Omni)交互时代至今,Speech LLM 虽然在拟人化和低延迟上取得了长足进步,但面临一个令人困扰的现象:当大语言模型(LLM)被赋予 “听觉” 后,它的智商下降了。

即便是同样的底层模型,一旦输入从文本变成语音,其逻辑推理能力(Reasoning)往往会显著衰退。这种现象被称为“模态推理鸿沟”(Modality Reasoning Gap)

这个难题并非仅存在于学术界,而是 OpenAI、Google、Meta 等行业巨头都在试图跨越的 “天花板”:

  • 根据Big Bench Audio评测,以 GPT-4o 为例,在纯文本任务(Text-to-Text)的准确率达92%;但一旦切换到端到端语音模式(Speech-to-Speech),其得分跌至66%。这中间26%的巨大跌幅,就是模型引入语音而付出的代价。
  • Google Gemini 团队在技术分享中将其定义为Intelligence Gap;而 Meta 研究员在 NeurIPS 2025 上更是直言这是一种Intelligence Regression,并提出了一个生动的概念Multimodal Tax,即引入音频等多模态数据往往会 “挤占” 模型用于纯推理的能力。

为了解决这一核心痛点,香港中文大学(深圳)与微软团队联合提出了TARS(Trajectory Alignment for Reasoning in Speech)。这是一项基于强化学习(RL)的全新对齐框架,它不依赖死记硬背的监督微调,而是通过对齐 “思维轨迹”,成功将语音输入的推理表现100% 恢复甚至超越了纯文本基座水平。

  • 论文题目: Closing the Modality Reasoning Gap for Speech Large Language Models
  • 论文链接: https://arxiv.org/abs/2601.05543

核心痛点:为什么模型 “听” 得越多,“想” 得越偏?

目前的语音大模型(Speech LLM)通常采用 “语音编码器 + 适配器 + LLM” 的三段式架构。理论上,这应该能让语音输入无缝借用 LLM 强大的推理大脑。但现实是:引入语音模态后,推理能力出现了断崖式下跌

此前的研究主要试图从两个方向修补这一鸿沟,但都存在缺陷:

1. 输入端强行对齐(Input Fusion):

试图让语音特征在输入层就长得和文本 Embedding 一样。但语音天然包含语气、停顿等富语言信息,与紧凑的文本本质不同。仅依靠输入对齐这种表面功夫,无法解决深层的表征漂移(Representation Drift)—— 随着 Transformer 层数加深,语音激发的隐藏状态(Hidden States)会逐渐偏离文本的思考轨迹(即相同语义纯文本输入时,文本激发的隐藏状态),导致 “想岔了”。

2. 输出端死记硬背(SFT / 蒸馏):

这是最主流的做法,即通过监督微调(SFT)利用静态的 “语音 - 文本” 数据对进行训练,或者通过知识蒸馏(Distillation)让文本分支作为 “老师” 来指导语音分支这个 “学生”。这些本质上都属于 Off-policy(离线策略),试图强行让语音分支去模仿文本的 Token 输出分布。但这有两个问题:

  • 目标不可达: 语音的噪声和副语言特征决定了其输出分布不可能和纯文本完全一致。
  • Exposure Bias: 这种静态监督无法容错。推理时只要错一个 Token,模型就会跌入训练未见过的状态,导致后续回复全盘崩溃。

TARS 的核心洞察在于: 既然死记硬背行不通,能不能用强化学习(RL),让模型自己在 “思考过程” 中去动态对齐文本的轨迹,而不是对齐具体的字?

TARS:用强化学习重塑语音推理轨迹

TARS 是一个基于On-policy RL(具体采用 GRPO)的对齐框架。它巧妙地利用模型自身的文本分支作为 “动态导师”,通过三个关键创新,把语音分支的 “脑回路” 掰回来。

创新一:表征对齐(Representation Alignment)

既然 Gap 和 “表征漂移” 相关,TARS 选择直接从模型内部开刀。

  • 做法: 计算语音作为输入,推理过程中每一层的隐藏状态(Hidden States),与同一模型在文本输入下(文本输入和语音输入在语义上完全相同)的隐藏状态计算余弦相似度,作为表征对齐奖励。

  • 作用: 这就像给语音分支装了一个 “导航仪”。它不再只关注结果,而是引导语音分支的每一层思维路径都时刻紧跟文本分支的轨迹,防止跑偏。

创新二:行为对齐(Behavior Alignment)

为了避免 SFT 的死板,TARS 在输出端引入了更灵活的对齐标准。

  • 作用: 解决了 “目标不可达” 的问题。允许语音和文本在措辞上有差异,只要逻辑对、意思对就能拿分。这让模型在探索中学会了自我修正,而非机械模仿。

创新三:非对称奖励与模态归一化

在 RL 训练设计上,TARS 针对模态差异做了对应优化:

1.非对称奖励(Asymmetric Reward): 文本分支只拿基础奖励(保住基本盘),语音分支额外拿对齐奖励(拼命追赶文本)。

2.模态特定归一化(Modality-Specific Normalization): 这一点至关重要。由于语音推理更难,往往得分较低,如果混合归一化,语音分支会一直收到负梯度。TARS 将两者分开归一化,让语音分支 “自己跟自己比”,保证了持续的优化梯度 —— 即使在所有样本任务准确率都为 0 的极端困难情况下,对齐奖励依然能指导模型进步。

实验结果:推理能力 100% 复原

团队在UnifiedQA数据集上训练,并在MMSUOBQA两个高难度语音推理榜单上进行了验证。实验基于 Qwen2.5-Omni 和 Phi-4-MM 架构。

核心战绩:MRR 突破 100%

  • 模态恢复率(MRR): TARS 在 7B 模型上达到了100.45%(Table 1 最后一行)。这意味着,语音输入的推理能力不仅完全填补了引入音频带来的坑,甚至略微超过了文本基座的表现。
  • 碾压基线: 相比 SALAD、AlignChat、KD 等 SOTA 方法,TARS 在 Phi-4-MM 上的准确率达到了79.80%(Table 1 最后一行),稳居 7B 规模模型第一,且显著优于 SFT 和 DPO 基线(Table 2)。

TARS 不是在拆东墙补西墙!

实验发现,TARS 的对齐并不是 “拆东墙补西墙”。在使用 TARS 训练后,模型的文本准确率也同步提升(Qwen: +2.39%, Phi: +5.43%)。这证明语音模态学习到的知识,能够同时增强文本的推理能力。

总结与展望

TARS 的提出标志着语音大模型研究的一个转折点:

1.范式转变: 证明了On-policy RL在解决模态对齐问题上优于传统的 Off-policy(SFT / 蒸馏)方法。

2.轨迹对齐: 提出的 “表征(过程)+ 行为(结果)” 对齐策略,有效消除模态推理鸿沟。

TARS 证明了语音大模型完全可以拥有和纯文本模型同等的 “智商”。对于致力于打造全能型 Omni 模型的研究者而言,TARS 提供了一条通往高智商语音交互的可行路径。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
国乒最新战报!世界冠军被轰3-0,王艺迪三线冲冠,单打2胜5负!

国乒最新战报!世界冠军被轰3-0,王艺迪三线冲冠,单打2胜5负!

刘姚尧的文字城堡
2026-09-18 20:17:34
亚运会女子100米栏还未开赛,恶心的一幕发生,吴艳妮再遭质疑

亚运会女子100米栏还未开赛,恶心的一幕发生,吴艳妮再遭质疑

云上乌托邦
2026-09-18 18:19:52
自称战狼的都是什么货色,可想而知

自称战狼的都是什么货色,可想而知

基本常识
2026-09-18 00:47:59
没有准备好!胡金秋:我们把比赛想得太简单了

没有准备好!胡金秋:我们把比赛想得太简单了

澎湃新闻
2026-09-18 21:47:08
泽连斯基已经向全世界亮明态度:乌克兰可以向俄罗斯投降,也可以放弃加入任何国际组织,但是唯独顿巴斯是坚决不会放弃!

泽连斯基已经向全世界亮明态度:乌克兰可以向俄罗斯投降,也可以放弃加入任何国际组织,但是唯独顿巴斯是坚决不会放弃!

扶苏聊历史
2026-09-18 18:02:45
俄罗斯杜马选举:执政党五大领衔候选人名单,梅德韦杰夫、绍伊古未列其中

俄罗斯杜马选举:执政党五大领衔候选人名单,梅德韦杰夫、绍伊古未列其中

红星新闻
2026-09-18 14:50:31
外衣透,内衣漏:女装,完了

外衣透,内衣漏:女装,完了

视觉志
2026-09-18 19:22:28
美国返还中国58件文物!其中一菩萨像系日本人金条买通住持盗凿,盗贼还低价买空恭王府

美国返还中国58件文物!其中一菩萨像系日本人金条买通住持盗凿,盗贼还低价买空恭王府

不掉线电波
2026-09-18 11:58:04
难受了?欧盟低估了中国。9月17日,据英国金融时报消息,欧盟已经正式宣布要求中国自愿限制混合动力车的出口

难受了?欧盟低估了中国。9月17日,据英国金融时报消息,欧盟已经正式宣布要求中国自愿限制混合动力车的出口

扶苏聊历史
2026-09-18 17:09:53
深夜爆大瓜!匿名爆料引爆热搜:网传85花与前辈老公已离婚,约定等孩子长大再官宣

深夜爆大瓜!匿名爆料引爆热搜:网传85花与前辈老公已离婚,约定等孩子长大再官宣

火山詩话
2026-09-18 05:06:28
男篮惨败被钉耻辱柱!日本队却疯狂挑衅中国队:郭士强被打哭了?

男篮惨败被钉耻辱柱!日本队却疯狂挑衅中国队:郭士强被打哭了?

篮球快餐车
2026-09-18 20:31:53
拍出这张照片的人就是天才!网友:不得不佩服

拍出这张照片的人就是天才!网友:不得不佩服

摄影技巧入门教程
2026-09-18 16:18:32
广西“替人养子”事件冲上热搜:一个出轨女,害惨三代人……

广西“替人养子”事件冲上热搜:一个出轨女,害惨三代人……

桌子的生活观
2026-09-18 12:45:59
中日篮球史上最耻辱一战!杨毅气得飙脏话,付政浩:郭士强辞职吧

中日篮球史上最耻辱一战!杨毅气得飙脏话,付政浩:郭士强辞职吧

十点街球体育
2026-09-18 23:34:32
敬一丹悼念会仅一天,荒唐一幕接连上演,洋女婿缺席仅是开胃菜

敬一丹悼念会仅一天,荒唐一幕接连上演,洋女婿缺席仅是开胃菜

不似少年游
2026-09-18 16:35:45
智谱ZCode被曝偷传用户数据,官方致歉

智谱ZCode被曝偷传用户数据,官方致歉

识礁Farsight
2026-09-18 18:06:56
被打崩绝非偶然!中国男篮高大身躯下,却是“民国篮球”的现实

被打崩绝非偶然!中国男篮高大身躯下,却是“民国篮球”的现实

中国足球的那些事儿
2026-09-18 20:20:14
住集装箱、男女混住、机场干等6小时?别再骂亚运会日本主办方了,真没故意坑外国选手

住集装箱、男女混住、机场干等6小时?别再骂亚运会日本主办方了,真没故意坑外国选手

可达鸭面面观
2026-09-18 13:22:17
王鹤棣疯传做阴茎增大术坏死!「诊所急发3点声明」 热搜爆了压不下来

王鹤棣疯传做阴茎增大术坏死!「诊所急发3点声明」 热搜爆了压不下来

ETtoday星光云
2026-09-17 13:51:01
广东佛山一男子高空作业从30楼下到2楼,发现绳子被2楼老人剪断,当事人:老人不知是高空作业,想当晾衣绳用,已赔偿费用

广东佛山一男子高空作业从30楼下到2楼,发现绳子被2楼老人剪断,当事人:老人不知是高空作业,想当晾衣绳用,已赔偿费用

潇湘晨报
2026-09-18 15:47:14
2026-09-19 04:59:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14023文章数 142733关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

教育
亲子
数码
艺术
公开课

教育要闻

家委会气爆了!一小学班委会集资买打印机,被家长投诉,被迫解散,而此后上演的才是大戏

亲子要闻

带中俄混血宝宝来广州,战斗娃魔丸属性突然觉醒,丽安差点招架不住!

数码要闻

Realforce静电容键盘GX1 Plus皮卡丘版亮相TGS2026

艺术要闻

好色也分段位?这位时尚摄影大师,直接杀进王者局!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版