"把会议改到下周三——不,周四。" 过去,语音识别系统会一字不差地记下这句"废话"。现在,它终于学会了:用户最后说的那个词,才是真实意图。
2026年8月4日,腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview。这不是一次常规的版本迭代,而是一次范式跃迁——语音识别从"逐字转写、单点优化"的时代,正式迈入"理解语境、兼容场景、一键直出"的新阶段。
一、核心数据:三语种WER全部压进3%俱乐部
先上硬指标。在开源评测集上,Hy ASR 3.0 preview 的多语种词错误率(WER)全部控制在 3%左右:
语种
WER
中文普通话
3.34%
英语
2.62%
粤语
3.12%
这是什么水平?作为参照,当前行业主流中文语音识别系统的WER普遍在4%-6%区间。将普通话WER压到3.34%,意味着每100个词中仅错3个——这已经接近人类专业速记员的水平。
更值得关注的是**粤语WER 3.12%**。方言识别一直是语音技术的"硬骨头",粤语因声调复杂、与普通话差异大,长期是识别重灾区。Hy ASR 3.0 preview 在粤语上做到了与普通话几乎持平的准确率,这背后是覆盖 10大方言片区、20余个二级小片区 的SFT数据体系在支撑。
二、技术架构:Hy3"语言大脑" + MoE + 自研语音Encoder
Hy ASR 3.0 preview 的能力跃升,不是单一模块的功劳,而是架构、数据、后训练三重优化的结果。
1. 基座升级:Hy3大语言模型
模型的"大脑"是腾讯混元最新一代大语言模型 Hy3。这款7月6日刚发布的MoE架构模型,总参数2950亿、激活参数210亿,支持256K超长上下文,采用Apache 2.0开源协议。
Hy3的"快慢思考融合"机制,让模型在处理简单语音时快速响应,遇到复杂语境则进入深度推理——这正是上下文纠错、语义消歧能力的基础。
2. 架构层面:MoE + 自研无监督语音Encoder
Hy ASR 3.0 preview 采用 MoE(混合专家)架构,兼顾效率与性能。在语音侧,团队自研了无监督语音Encoder,通过数千万小时级无监督语音数据训练,使其能够从复杂音频中提取高质量的声学表征。
随后,语音Encoder与大语言模型进行联合训练,引入数千万小时级、多来源的语音数据,覆盖多种方言、口音和声学环境。
3. 后训练:多阶段SFT + 强化学习
在大规模联合预训练基础上,团队构建了高质量的SFT(监督微调)recipe,覆盖上下文context、专业名词、不同声学环境及多样人群语音。在此基础上进一步引入多阶段强化学习,分别针对通用转写准确性、Any-context上下文能力和复杂长尾场景进行优化。
三、四大能力突破:从"听见"到"听懂"
腾讯混元官方将Hy ASR 3.0 preview的核心提升归纳为四类:
① 通用识别更准确
普通话、方言、中英混说——全场景识别准确率提升,减少错字、漏字及长音频中的错误累积。
② 更能理解用户意图(Context感知)
这是本次升级最革命性的能力。模型能够结合上下文精准捕捉用户语境,智能纠错同音词,消除语义歧义。
举个例子:当你连续描述一段代码、一个产品名或一个生僻人名时,传统ASR会根据发音选一个常见词。而Hy ASR 3.0 preview会参考前文已经出现的话题和术语,判断后续最可能的正确写法。
再比如那句"下周三——不,周四",模型会理解用户的自我修正意图,输出最终确认的结果,而非机械保留中间表达。
③ 更容易适配专业场景(热词注入)
支持热词注入增强,企业可以注入品牌名、人名、行业术语等专有词汇,帮助模型快速识别。这大幅降低了业务接入和持续维护成本。
④ 复杂环境下更稳定
针对高噪、耳语、悄悄话等多种声学场景进行专项优化。在地铁、咖啡厅、会议室等真实嘈杂环境中,依然保持稳定表现。
四、行业意义:ASR竞争进入"语义理解"下半场
2026年的中国智能语音市场,CR4(前四大厂商集中度)已超过65%。科大讯飞以23.4%市占率领跑,百度、阿里云、腾讯云分列其后。
但行业正在发生一场静默的范式转移:
传统ASR的核心目标是"听清每一个字";新一代ASR的核心目标是"理解用户想说什么"。
Hy ASR 3.0 preview的定位恰好处于"传统ASR"与"端到端语音大模型"之间:它仍以高精度转写为中心,但将Hy3的语言理解能力深度注入识别过程,强化上下文、专业术语和场景化判断。
这种"中间路线"的优势在于可控性与语义能力的平衡——纯语音大模型可能更擅长理解指令,但在逐字转写、时间戳对齐、可审计性上不够稳定;传统ASR文本可追溯,但容易把口语错误原样输出。Hy ASR 3.0 preview试图让结果既忠实于原声,又能在需要时自动修正明显的上下文错误。
五、落地与生态:元宝首发,腾讯云API全面开放 元宝App:首发且免费
腾讯元宝深度参与共研,已完成首发上线。用户打开元宝按住说话,即可体验方言识别、上下文智能纠错与复杂环境稳定转写——且完全免费。
腾讯云API:开发者即插即用
Hy ASR 3.0 preview 已上线腾讯云官网,对外提供API服务,可广泛应用于:
智能客服
内容理解
语音搜索
会议转写
短视频字幕
WorkBuddy等产品也在陆续接入中。
对于开发者而言,这意味着无需自研方言识别或噪声模型,即可将顶级ASR能力集成进自己的产品中。
六、冷静审视:Preview之后,还有什么期待?
尽管Hy ASR 3.0 preview的发布令人振奋,但作为"preview"版本,仍有几项关键指标有待观察:
维度
待验证问题
实时性
流式识别的首token延迟、长连接稳定性如何?
定价
API按音频时长还是请求数计费?免费额度多少?
输出结构
是否支持时间戳、说话人分离、置信度分数?
数据合规
音频保留多久?是否用于训练?企业版合规选项?
对于金融、医疗、司法等强调原始证据的场景,开发者仍需保留原始音频和原始转写,而非仅存储模型修正后的最终文本——毕竟,**模型越主动使用上下文,就越要防范"合理但错误的猜测"**。
七、结语:语音交互的"理解时代"正式开启
腾讯混元用Hy ASR 3.0 preview发出了一个明确信号:
语音识别的下一程竞争,不再是谁"少错一个字",而是谁能在复杂语境中真正理解用户的意图。
当语音识别从"输入法的组件"进化为"AI产品理解用户的第一层入口",它的价值就不再是简单的"声音→文字"转换,而是意图→行动的桥梁。
从元宝App的免费体验,到腾讯云API的开放调用,腾讯正在把这项技术从"实验室指标"推向"生产力工具"。而对于整个AI行业来说,Hy ASR 3.0 preview或许标志着:语音交互的"理解时代",真的来了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.