对着手机说一段话,屏幕上跳出一大段文字,读一遍却怎么都发不出手
![]()
- 语气词、重复的词、说到一半改口的碎片,全被一字不落地记了下来。
- 对方一眼就能看出这是语音转写。
- 于是还得手动删一遍、补一遍标点,打字的功夫一点没省。
嘈杂的地方同样让人犯怵
- 地铁里、饭馆里、街边,说的话常常被环境声盖掉一半,识别结果只能靠猜。
- 带口音的普通话更麻烦,往往得先切换方言模式,忘了切就满屏错字。
9月23日,科大讯飞发布新一代语音识别大模型Spark-ASR-2.0
- 并从9月24日起陆续上线讯飞输入法。
- 官方对这次变化的概括是:从"一字不差"走向"出口成章"。
- 过去的语音识别追求把说过的内容原样还原。
- 新模型在保持识别准确率的同时,会结合上下文逻辑与语境理解,精简冗余表达、精修各类细节,让输出更连贯、语义更清晰。
具体改善集中在四个方面
![]()
一、是通用识别
- 包含中英文混合、方言和专业术语。
- 中英文夹杂的句子,以及医学、化学、科技领域里拗口的术语,识别表现都有提升。
二、是复杂声学场景
- 包括高噪声、小音量、快语速和儿童语音。
- 官方称,与当前业界最好水平相比,它在方言、高噪和小音量上拥有显著优势,主要任务效果均好于业界最优水平。
三、是上下文识别
- 识别过程会融合此前的识别历史、修改记录和个人热词。
- 用来消解语义歧义、易混淆发音和相似名词带来的偏差。
四、是文本流畅规范性
- 语气词、犹豫时重复的词语、口头禅不再被原样记录。
- 标点、数字、符号和单位也会按表达规范补全与转换。
用法上没有新增门槛
- 在应用商店安装或更新讯飞输入法,进入输入界面点开麦克风,长按说话即可。
- 遇到总被念错的人名、地名或产品名,可以把它加进讯飞输入法的个人语音词库。
- 之后再听到同样的发音,就会优先按你设定的写法输出。
几类马上能派上用场的场景
![]()
- 走路、开车、做家务腾不出手的时候,一段话说完就是一段完整的话;
- 开会时把发言转成文字纪要,不必再逐句整理;
- 长辈不习惯拼音,用家乡话直接说也能成文;
- 长消息、长备忘录用语音起稿,省掉反复修改的时间。
方言这块是这轮最实用的部分
- 官方介绍,Spark-ASR-2.0支持全国202个城市的方言免切换识别,不需要先选定语种再开口。
成本的账也值得提一句:
- 在效果明显提升的同时,整体推理成本相比上一代只增加了10%。
- 支撑这次升级的是不久前发布的语音基座大模型Spark-Audio-1.0-Preview,官方称团队在智能语音的多个技术方向上由此实现了突破。
技术上
- 这一代采用非自回归与大模型增强自回归协同的架构,配合中英文混合文本与声学联合增强、动态上下文注入等做法。
- 把识别的准确性、实时性、语言理解和文本规范放在一起优化。
除了输入法
- 这套能力还会陆续落到讯飞AI眼镜、讯飞智能办公本、讯飞听见等产品上。
- 面向开发者和企业,它也通过讯飞开放平台提供了API服务。
官方列出的下一步重点还有三项
- 在多人交谈与复杂噪声中锁定目标说话人。
- 用语音指令直接修改已识别的内容。
- 以及结合情感表达调整标点与措辞。
有三处边界需要先说清楚
![]()
一、是上线节奏
- 官方措辞是"逐步上线",意味着分批放量,
- 不同账号覆盖到的时间可能有先后,具体以App内实际表现为准。
二、是成绩口径
- 上述改善均来自官方公布的测试与说明,属于模型层面的结果,不等同于每个人在App里拿到的实际效果。
- 按官方说明,测试样本取自讯飞星火、讯飞听见、讯飞翻译机、讯飞输入法以及开放平台语音接口的真实请求并保持滚动更新,以词错误率、字错误率等指标衡量,数值越低越好。
三、是权益范围
- 讯飞输入法个人版的打字、语音输入、智能纠错、云词库等核心功能不额外收费。
- 部分皮肤、个性音效等增值内容需要单独订阅。
语音输入的竞争方向正在变化
- 不再只比谁识别得准,而是比谁能直接给出一段可以发出去的文字。
- 把润色这一步交给模型,等于把"说完还要改一遍"这个动作省掉了。
原创内容。如果你觉得有帮助,欢迎关注「AI工具跃迁」,每天发现一片AI新大陆~
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.