长久以来,语音识别的核心目标是完成语音到文字的忠实转写。科大讯飞Spark‑ASR‑2.0的发布,推动这项技术迈向新的发展阶段。该模型基于Spark‑Audio‑1.0‑Preview语音基座,融合多项创新技术,不再局限于简单还原说话内容,而是兼顾声学识别与语言理解,输出语义通顺、格式规范的文本内容。面对现实世界多样化输入条件,模型解决了不少实际痛点。方言使用无需手动切换模式,覆盖全国202个城市;跨语言对话时,中英文交替语句识别稳定性提升;医学、科技领域的专业名词识别准确度改善。在嘈杂环境、音量微弱、语速较快等不利条件下,依旧可以保持稳定识别效果。依靠动态上下文注入,参考历史输入、用户修改习惯,持续降低识别错误。技术层面依靠非自回归与LLM增强自回归协同架构,平衡识别时延与效果,推理成本相比上一代仅提升一成。9月24日开始,讯飞输入法将逐步搭载该模型,开放平台对外提供API服务,后续能力会拓展至讯飞AI眼镜、智能办公本、讯飞听见等产品。面向未来,技术研发还将向人声辨识、语音编辑、情感化文本输出三个方向持续迭代。
#语音及语言信息处理国家工程研究中心##大模型国家队##全栈自主可控#
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.