凌晨三点,一个跨国会议正在进行。东京的工程师用日语说完一段话,下一秒,屏幕上同时出现了日文和英文的实时字幕,连说话人是谁都标得清清楚楚。这不是科幻片,这是Meta刚刚发布的实时语音识别模型Muse Voice Transcribe正在做的事。
9月1日,Meta Superintelligence Labs(Meta超智能实验室)正式发布了旗下首个实时音频感知模型Muse Voice Transcribe。在AI评估平台Artificial Analysis的排行榜上,这款模型直接拿下了流媒体语音识别领域的头名位置。
![]()
识别精度:错误率仅3.1%
![]()
在Artificial Analysis的流媒体语音识别测试中,Muse Voice Transcribe在检测到说话结束后生成的"最终转录"中,错误转录的单词比例仅为3.1%。这个数字越低代表精度越高,而3.1%的成绩已经让它站在了同类模型的前列。
除了转录精度,模型在说话人识别能力上的得分同样表现出色。在多人对话场景中,它区分不同说话人的错误率明显低于其他对比模型。这意味着,即使面对嘈杂的多人会议,它也能准确判断"这句话是谁说的"。
定价策略:每小时不到30日元
性能之外,价格是另一个让人意外的点。根据Artificial Analysis的数据,Muse Voice Transcribe的使用成本为每小时0.18美元(约合29日元),或者按1000分钟(16小时40分钟)3美元(约合480日元)的批量价格计算。相比同类产品,这个定价明显更低。
低价的底气来自哪里?Meta在训练阶段就做了大量投入。模型训练使用了70多种语言的数据,其中25种语言经过了广泛的验证,覆盖了阿拉伯语、英语、法语、德语、印地语、日语、韩语、中文(普通话)、西班牙语、泰语、越南语等主要语种。
双语者的福音:无缝代码切换
对经常在两种语言之间切换的双语使用者来说,Muse Voice Transcribe解决了一个长期痛点。代码切换(code-switching)——即在对话中交替使用多种语言——是双语者的日常习惯。这个模型原生支持句子级别和句子内部的代码切换,并利用上下文偏置(context bias)机制来提升识别准确率。
换句话说,当你在中文对话里突然蹦出一个英文专业术语时,它不会像老式语音识别那样卡壳或乱猜,而是能根据上下文准确捕捉你真正想说的词。
![]()
长音频与多人对话:无需后期处理
在应用场景上,Muse Voice Transcribe支持1小时以上的长音频,以及20人以上
这对会议记录、访谈整理、播客字幕生成等场景来说,意味着工作流程的极大简化。以前需要录音后花大量时间人工标注"谁说了什么",现在模型在实时转录的同时就把这件事做完了。
产品定位:Muse Spark家族的新成员
Muse Voice Transcribe是Meta Superintelligence Labs推出的多模态推理模型Muse Spark家族中的一员,属于自回归多模态模型。它将于2026年9月2日起,通过Meta Model API、Meta AI for Mac以及Muse Code渠道正式开放使用。
从时间线来看,Meta在AI语音赛道上的动作正在加速。Muse系列模型从推出到迭代,仅用了4个月时间就在第三方性能分析中拿下高分。这次实时语音识别模型的落地,补上了Meta在音频感知领域的一块重要拼图。
对于开发者来说,0.18美元/小时的定价和20人以上的说话人识别能力,意味着实时会议转录、多语言客服、语音笔记等应用的成本门槛被大幅拉低。接下来值得关注的,是这款模型在实际业务场景中的表现,以及它是否会像Muse Spark一样,在短时间内迎来快速迭代。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.