实时字幕最让人抓狂的不是慢,是跳。一句话刚显示出来,半秒后又被改掉,再半秒又变一次。看直播的人眼睛累,做字幕的人更累。网易有道发布的实时语音识别模型 Confucius4-R2T2,想解决的就是这个老毛病。
它的核心思路只有六个字:只增不改。已输出的文本不再回头修改,新内容以追加的方式往后接。字幕一旦出现就固定下来,不会因为模型后面"想通了"而反复变动。传统实时 ASR 的闪烁,根源就在于模型边听边改,越改越乱。
![]()
没把握的部分先憋着
只增不改听起来简单,难的是怎么保证追加的内容是对的。Confucius4-R2T2 的答案是 LSP 策略,即 Look-ahead Selective Prefix。模型持续监听,只有在通过上下文确认之后才把内容定稿输出。用素材里的说法,没把握的部分先憋着,等听到更多上下文再说。
这套机制把延迟控制在 200-600ms。对实时字幕来说,这个区间既不至于让人感到明显滞后,又给了模型足够的上下文来判断该不该定稿。稳定和实时,在这里不是二选一。
80ms 到 2s,自己调
模型基于 Qwen3-ASR 架构,解码块大小支持在 80ms 至 2s 之间调节。这个参数直接决定精度与速度的权衡:
- 块调小,响应更快,适合对时效敏感的直播场景
- 块调大,上下文更充分,识别精度更高,适合会议记录
用户可以根据场景自主选择配置,而不是被锁死在厂商预设的一档参数上。直播要的是跟得上,会议要的是记得准,两种需求本来就不该用同一套配置。
实时字幕的体验分水岭,从来不是识别率小数点后那一位,而是文字会不会在眼前乱跳。把已输出的内容钉死,把不确定的部分压后,这个取舍方向值得做实时语音的团队参考。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.