网易首页 > 网易号 > 正文 申请入驻

刚刚!阿里发新模型,幻觉率爆降70%

0
分享至

智东西9月15日报道,今天,阿里巴巴通义实验室推出了FunAudio-ASR端到端语音识别大模型。这款模型通过创新的Context模块,针对性优化了“幻觉”、“串语种”等关键问题,在高噪声的场景下,幻觉率从78.5%下降至10.7%,下降幅度接近70%。

FunAudio-ASR使用了数千万小时的音频数据,融合了大语言模型的语义理解能力,从而提升语音识别的上下文一致性与跨语言切换能力。

通义实验室打造了5大类测试集,重点关注语音识别在远场、嘈杂背景等挑战性场景下的表现,并结合开源测试集评估了模型的性能。FunAudio-ASR实现了超越Seed-ASR、KimiAudio-8B等业内知名模型的表现。

同时,FunAudio-ASR在实际落地方面也进行了全面优化,支持低延迟流式识别、跨中英文自然切换以及用户可自定义的热词识别,能够覆盖视频会议、实时字幕、智能终端等多样化应用场景。

FunAudio-ASR提供两个版本,满血版由0.7B参数量的编码器和7B参数量的大语言模型组成,追求最高精度;轻量的nano版本由0.2B参数量的编码器和0.6B参数量的大语言模型,平衡效率与精度。目前,FunAudio-ASR已在钉钉的“AI听记”、视频会议、DingTalk A1硬件等多个场景中应用。

FunAudio-ASR已上线阿里云百炼平台,API定价为0.00022元/秒,转录一段一小时的音频大约需要8毛钱。这款模型的技术报告已经发布,开发者也可在魔搭社区体验其效果。

魔搭社区体验:

https://modelscope.cn/studios/iic/FunAudio-ASR

阿里云百炼平台:

https://help.aliyun.com/zh/model-studio/recording-file-recognition?spm=a2c4g.11186623.help-menu-2400256.d_0_3_1.f43e7432ytYkAa&scm=20140722.H_2880903._.OR_help-T_cn~zh-V_1

技术报告:

https://github.com/FunAudioLLM/FunAudioLLM.github.io/blob/master/pdf/FunAudio-ASR.pdf

一、幻觉、串语种问题获针对性优化,一手体验高噪声环境识别效果

相比于文本大模型,语音大模型的“幻觉”问题尤为突出。这是因为声学特征与文本特征在向量空间上天然存在差异,导致模型在“听”完音频后,容易“脑补”出大量不存在的内容。

尽管通过训练,可以将将声学特征对齐到文本特征空间,但声学特征Embedding与真实的文本Embedding仍然存在这一定的差距,这会导致大语言模型在生成文本时发生幻觉的现象。

▲声学特征Embedding与真实的文本Embedding分布差异(图片来源:https://arxiv.org/pdf/2410.18908)

通义实验室发现,给语音大模提供必要的上下文,可以减少文本生产时候的幻觉现象。为此,他们设计了Context增强模块:该模块通过CTC解码器快速生成第一遍解码文本,并将该结果作为上下文信息输入大语言模型,辅助其理解音频内容。

由于CTC结构轻量且为非自回归模型,几乎不增加额外推理耗时。

例如,对于这段由AI生成、模仿海盗说话风格的音频,FunAudio-ASR做到了一字不差的识别。

(待插入)

此外,通义实验室还观察到幻觉问题在高噪声场景中更易发生,因此在训练数据中加入了大量仿真数据。

为评估模型在高噪声情况下的表现,他们构建了一个包含28条易触发幻觉音频的测试集,经优化后,幻觉率从78.5%下降至10.7%。

智东西在实测中体验了FunAudio-ASR在嘈杂场景的识别能力。这段音频是在嘈杂的展会现场录制的。可以听到,模型基本准确识别了片段中男性说话者的声音,但在声音音量骤降后识别错误了。

(待插入)

同时,这段音频中有两位说话者,FunAudio-ASR在识别两人同时说话的部分时,遗漏了一些信息。

与OpenAI Whisper Large V3的识别结果对比,FunAudio-ASR识别出了更多正确的信息。

“串语种”是语音大模型落地中的另一类典型问题,例如,输入音频内容为英文,模型输出却为中文文本。

这是因为文本大模型本身具备翻译能力,在声学特征映射不够精确时,模型可能在推理过程中“自动启动”翻译功能,从而影响语音识别的准确性。

在FunAudio-ASR的Context增强模块中,CTC解码器经过高质量数据训练,本身发生串语种的概率极低。通过将CTC的第一遍解码结果作为提示词输入给大语言模型,可有效引导模型聚焦于语音识别任务,缓解“翻译”行为的发生。

二、支持术语定制化识别,召回率提升明显

在企业运用语音识别模型时,个性化定制是必不可少的技术。所谓定制化,是指在识别过程中对特定词/短语(如人名、地名、品牌、专业术语等)施加额外概率偏好,从而显著提高它们的识别召回率,同时尽量不损伤通用识别准确率。

当前行业的主流做法是将用户提供的领域词,直接作为提示词输入大语言模型。该方法虽简单有效,但随着词量增加,干扰也随之上升,导致召回率下降——即“定制化能力衰减”。

为缓解这一问题,通义实验室在Context增强结构中引入RAG(检索增强生成)机制,这一机制的运作方式如下:

(1)构建知识库:将用户配置的定制词构建成专属RAG库;

(2)动态检索:依据CTC第一遍解码结果,从RAG库中抽取相关词汇;

(3)精准注入:仅将相关词汇注入大语言模型的提示词中,避免无关信息干扰。

该方案在不增加推理复杂度的前提下,将定制化上文数量扩充到上千个以上,并且保持较高的定制化识别效果。

为验证模型的定制化效果,通义实验室在微积分学、有机化学、物理学、哲学、人名等5个领域,选取了1000个专业词汇进行测试。FunAudio-ASR在关键词准确率上表现超越了支持同类功能的语音识别模型。

例如,采用FunAudio-ASR模型的钉钉“AI听记”,拥有对互联网、科技、家装、畜牧、汽车等10+领域、200+细分行业术语的识别能力,并支持在企业授权前提下,结合通讯录、日程等上下文信息进行推理优化,进一步提升结果可靠性。

三、预训练使用数千万小时数据,仅用8张A100完成强化学习

技术报告中,通义实验室阐述了FunAudio-ASR的技术细节。这一模型包含四个核心组件:

(1)音频编码器(Audio Encoder):提取语音特征,使用多层Transformer Encoder。

(2)音频适配器(Audio Adaptor):连接编码器和LLM,使用两层Transformer Encoder。

(3)CTC解码器:用于初步识别假设,支持热词定制。

(4)基于大语言模型的解码器:结合音频特征和CTC预测生成最终输出。

▲FunAudio-ASR模型架构

预训练阶段,FunAudio-ASR使用了数千万小时的音频数据,包括无标注音频和有标注的音频-文本数据,数据涵盖AI、生物、电商、教育等多个领域。

预训练分为自监督预训练和有监督预训练。在自监督阶段,FunAudio-ASR创新地使用Qwen3的权重初始化编码器,加速收敛并提升表示质量。

有监督预训练则在编码器-解码器架构(AED)下进行,使编码器能够从大规模标注数据中学习更丰富的声学-语言特征,为后续与大语言模型的整合奠定基础。

▲FunAudio-ASR预训练管线

在此基础上,FunAudio-ASR进入有监督微调(SFT)阶段,该阶段进一步分为五个子阶段,逐步优化不同模块:

(1)训练适配器以对齐音频表示与大语言模型的语义空间;

(2)优化编码器和适配器;

(3)使用LoRA微调大语言模型以防止灾难性遗忘;

(4)全参数微调阶段;

(5)引入CTC解码器用于后续的热词检索与增强生成(RAG)。

整个SFT过程使用了数百万小时的多源数据,包括人工标注语料、伪标注数据、合成语音和噪声增强数据等,确保了模型在多样化场景下的泛化能力。

为了进一步提升模型对长音频和上下文信息的理解能力,团队还构建了超过5万小时的上下文增强训练数据。

通过提取关键词、合成相关上下文并混合无关语境,模型学会了在保持高识别精度的同时,有效利用对话历史信息,显著提升了在复杂语境下的表现。

在强化学习(RL)阶段,团队提出了专为音频-语言模型设计的FunRL框架,支持多模块高效协同训练。

▲FunRL框架

该框架采用GRPO算法,并设计了多目标奖励函数,综合优化识别准确率、关键词召回、幻觉抑制和语言一致性。模型仅使用8张A100显卡,在一天内完成RL训练。

RL训练数据涵盖硬样本、长音频、幻觉样本、关键词样本和常规ASR数据,显著提升了模型在困难场景下的鲁棒性和用户体验。

最后,FunAudio-ASR还针对实际应用需求进行了全面优化,包括流式识别支持、噪声鲁棒性增强、中英代码切换处理、热词定制和幻觉抑制等。

结语:生成式AI赋能新一代ASR系统,或成智能交互重要入口

基于生成式AI的新一代语音识别模型,正在从“能听清”走向“能理解”,并在幻觉抑制、跨语种识别、上下文一致性等关键问题上展现出进展。

与传统以声学建模与统计学习为主的语音识别系统相比,这类模型不仅具备更强的语义理解与任务适配能力,还能在复杂噪声、多说话人、跨领域等场景中保持更高的鲁棒性和可控性。可以预见,未来语音识别有望告别单纯的“输入工具”,成为终端智能交互的重要入口。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
张学良儿子张闾琳辞世:9岁赴美,娶陈济棠侄女,所生两子皆成才

张学良儿子张闾琳辞世:9岁赴美,娶陈济棠侄女,所生两子皆成才

浩渺青史
2026-08-02 21:40:02
麦迪娜姜潮新疆大婚,切糕可以买一套房,婆婆站着亲妈坐着地位高

麦迪娜姜潮新疆大婚,切糕可以买一套房,婆婆站着亲妈坐着地位高

椰黄娱乐
2026-08-13 14:43:30
中国证监会原党委委员、原国有重点大型企业监事会主席马忠智逝世

中国证监会原党委委员、原国有重点大型企业监事会主席马忠智逝世

界面新闻
2026-08-13 19:11:00
民政部:上半年结婚登记327.5万对,同比下降7.46%;离婚登记138.3万对,同比增长3.91%

民政部:上半年结婚登记327.5万对,同比下降7.46%;离婚登记138.3万对,同比增长3.91%

投资者内参
2026-08-13 10:54:49
最高院:提供 “口交” “肛交”等进入式性服务,是否属卖淫行为?

最高院:提供 “口交” “肛交”等进入式性服务,是否属卖淫行为?

周军律师聊案子
2026-04-21 09:50:16
郭兰英每个月退休金到底有多少?看完她晚年日常,很多人直接沉默

郭兰英每个月退休金到底有多少?看完她晚年日常,很多人直接沉默

陈意小可爱
2026-08-13 00:55:01
反转!母亲证实雅典娜没死,潮汕商会曝猛料,网友:这比死还难受

反转!母亲证实雅典娜没死,潮汕商会曝猛料,网友:这比死还难受

李橑在北漂
2026-08-12 20:47:59
胖东来把全国房东都干懵了!

胖东来把全国房东都干懵了!

贩财局
2026-08-11 16:28:26
输掉房子!戈登这波还是太实在了!

输掉房子!戈登这波还是太实在了!

柚子说球
2026-08-13 21:02:02
女子打电话说要回娘家,离家后16年无音信,弟弟悬赏33万寻线索 警方:一直在按程序办理丨红星寻人

女子打电话说要回娘家,离家后16年无音信,弟弟悬赏33万寻线索 警方:一直在按程序办理丨红星寻人

红星新闻
2026-08-13 20:02:24
《披哥6》正式开录,哥哥们现身长沙,曹俊一身西装太帅,邵兵退赛遭全网吐槽

《披哥6》正式开录,哥哥们现身长沙,曹俊一身西装太帅,邵兵退赛遭全网吐槽

娱乐圈笔娱君
2026-08-13 18:09:43
太意外了!2032奥运举办地敲定:结果惊呆众人,奥运格局大变!

太意外了!2032奥运举办地敲定:结果惊呆众人,奥运格局大变!

小涛叨叨
2026-04-22 17:06:20
谁才是真正的高考地狱难度?31省录取大数据排名出炉

谁才是真正的高考地狱难度?31省录取大数据排名出炉

牛锅巴小钒
2026-08-13 12:20:04
腾讯史上最大豪赌:每天烧1亿,首次“花光”自由现金流

腾讯史上最大豪赌:每天烧1亿,首次“花光”自由现金流

南财社V
2026-08-13 23:42:09
房价大局已定?不出意外,2026下半年“中国房价”将迎来3大变化

房价大局已定?不出意外,2026下半年“中国房价”将迎来3大变化

细说职场
2026-08-13 15:45:40
出道即巅峰,现在跌到不足2000辆,乐道L90沦为了炮灰?

出道即巅峰,现在跌到不足2000辆,乐道L90沦为了炮灰?

车知事
2026-08-13 17:11:10
现世报应!重庆王先生转战西藏旅游,当地酒店餐馆集体预警,全城拒绝接待

现世报应!重庆王先生转战西藏旅游,当地酒店餐馆集体预警,全城拒绝接待

老猫观点
2026-08-12 17:36:09
南昌梅湖景区悲剧:19 岁汉服少女无辜殒命,最可怕的是无差别恶意

南昌梅湖景区悲剧:19 岁汉服少女无辜殒命,最可怕的是无差别恶意

老欧讲大案
2026-08-13 08:00:16
王金平敏感时刻探柯建铭,提醒韩国瑜动怒伤身

王金平敏感时刻探柯建铭,提醒韩国瑜动怒伤身

牛锅巴小钒
2026-08-14 00:11:15
中国女篮惨败,两大混子球员必须淘汰,宫鲁鸣固执,呼吁李梦回归

中国女篮惨败,两大混子球员必须淘汰,宫鲁鸣固执,呼吁李梦回归

宗介说体育
2026-08-13 14:00:49
2026-08-14 01:56:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12435文章数 117149关注度
往期回顾 全部

科技要闻

一切皆插件!DeepSeek Harness正式发布

头条要闻

冉莹颖被指称“输了换老公有保险”邹市明深夜回应

头条要闻

冉莹颖被指称“输了换老公有保险”邹市明深夜回应

体育要闻

负债十几亿的联赛,还在疯狂买球星

娱乐要闻

篡改红歌已立案,郭德纲大祸临头

财经要闻

可治疗癌症?神话破灭的片仔癀 陷入争议

汽车要闻

全新红旗H7到底新在哪儿?

态度原创

时尚
数码
家居
本地
亲子

HYROX赛场上的美照怎么拍出来的?

数码要闻

英伟达GeForce NOW原生Linux应用发布:结束Beta测试

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

黄州一夜,苏轼写给普通人的月光

亲子要闻

一个家过得怎么样,看孩子就知道

无障碍浏览 进入关怀版