语音 Agent 卡在哪里?很多人第一反应是转录不准。Krisp 与 Sumanth 合作的一项 Voice Isolation 基准测试给出了不同答案:真正的瓶颈,是背景里那些"抢话"的人。
这项测试覆盖 265 条真实录音和 11 种 STT 配置。结果显示,引入语音隔离后,整体 WER 从 23.3% 降至 6.2%。数字落差背后,是一个被长期混淆的问题被拆开了。
![]()
转对词,不等于转对人
测试把一件事拆成了两个独立问题:一是"转对了词语",二是"转对了说话人"。前者是传统 STT 的准确率指标,后者关乎这句话到底是谁说的。
对普通转录工具来说,这两者的差别或许还能忍。但对会调用工具、执行操作的语音 Agent 而言,把背景噪声误当作用户指令,是更严重的失败——它不只是记错一句话,而是可能触发一个本不该执行的动作。
换句话说,竞争说话人的干扰信号,正在成为语音 Agent 的核心风险点,而不是 STT 模型本身的准确率。
把语音隔离前置成独立环节
基于这一发现,测试给出的架构建议很直接:将语音隔离作为独立环节,前置插入整体流水线中。
这意味着语音隔离不再只是锦上添花的降噪处理,而是需要被当作流水线的第一道关口。先分清谁在说话,再谈转写和指令理解。
对正在做语音 Agent 的团队来说,这个顺序调整可能比换一个更强的 STT 模型更值得优先考虑。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.