Meta Superintelligence Labs 发布了一款名为 Muse Voice Transcribe 的实时音频感知模型,官方称这是业内首个此类模型。它最直观的能力是:一边听一边转文字,不用等整段音频结束。
能同时分辨20多个说话人,还能自动判断谁在何时开口(diarization)以及何时结束发言(endpointing)。多语言切换时无需停顿,中英文夹杂也能无缝衔接。
![]()
更实用的是,它支持通过语言、关键词和上下文偏置来提升准确率——比如你提前告诉它"这段对话里会频繁出现某个专业术语",识别结果就能更准。
![]()
在第三方评测机构 Artificial Analysis 的流式语音转文本和公开 diarization 基准上,Muse Voice Transcribe 目前均排名第一。Meta 这次把实时语音识别的门槛又抬高了一截。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.