语音转文字赛道最近竞争激烈。OpenAI的GPT-Transcribe刚发布不久,Google的Gemini 3.5 Transcribe也才上线一周,微软就带着新模型杀了出来,直接甩出两个数字:比GPT-Transcribe快10倍,比Gemini 3.5 Transcribe快5倍。
这个名为MAI-Transcribe-2的语音识别模型,由微软于9月3日正式发布,目前已在Microsoft Foundry平台上开放使用。官方口径很直接——"全球最快、最准、最便宜的语音识别模型"。
![]()
性能数据:不只是快,准确率也拿了第一
先看硬指标。在FLEURS基准测试中,MAI-Transcribe-2录得平均单词错误率5.2%,排名第一,超过了包括刚发布一周的Gemini 3.5 Transcribe在内的所有竞品。
速度方面,第三方评测机构Artificial Analysis的验证结果显示:MAI-Transcribe-2比OpenAI的GPT-Transcribe快10倍,比ElevenLabs的Scribe v2快7倍,比Google的Gemini 3.5 Transcribe快5倍——而且是在更快的同时保持更高精度。
这意味着什么?在同样处理一段录音时,微软这个模型能更快出稿,错误还更少。对需要批量处理音频的团队来说,这两个指标的提升直接换算成时间和返工成本的节省。
功能细节:说话人区分、术语识别、语气词开关
MAI-Transcribe-2并非只靠速度和准确率打天下。根据微软公布的信息,它支持60种语言的自动检测,用户无需提前指定语言,模型会自动识别并转录。
在功能层面,它有几个值得注意的能力:
- 说话人区分:能识别录音中的不同说话人,把每个词分配给正确的人
- 精确时间戳:掌握每个单词的准确时间点,方便后续的文字搜索和编辑
- 专业术语识别:对特定领域的术语、缩写以及仅靠上下文难以判断的词汇,有更好的识别表现
- 语气词可配置:可以选择保留或删除"嗯""啊"之类的填充词,按使用场景灵活切换
最后一点对两类用户都有价值:做播客字幕的想删掉语气词让文字更干净,做语言学分析的反而需要保留这些细节作为研究素材。
价格策略:限时低价,直接对标竞品
价格是这次发布里最敏感的部分。微软给出的定价是:2026年底之前,每小时转录费用0.1美元(约合人民币15.6元)。
Artificial Analysis对此做了横向对比:按每1000分钟计算,MAI-Transcribe-2的费用是1.67美元(约260.5元),而Scribe V2是3.67美元(约572.4元),Smallest AI Pulse Pro是4美元(约623.9元)。也就是说,微软这个模型的单价不到竞品的一半。
这个定价策略的意图很明显:先用低价和性能组合抢占市场份额,尤其是在开发者生态里建立使用习惯。限时两个字也暗示了后续价格可能上调,现在入场等于锁定了一段低成本窗口期。
迭代节奏:半年内三个版本,推理速度大幅提升
这不是微软第一次做语音识别模型。2026年4月,微软发布了MAI-Transcribe-1;6月推出1.5版本;这次发布的"2"在推理速度和延迟上都有明显改进。半年内三个版本的迭代节奏,说明微软在这个方向上的投入力度不小。
微软官方对这款产品的定位也毫不谦虚:"这不仅是公司历史上性能最强的转录模型,也是竞品中性能最强、效率最高的模型。"
竞争格局:语音转录赛道进入三强混战
把时间线拉长看,这个赛道的竞争正在加速。Meta此前发布了实时转录AI Muse Voice Transcribe,Google推出了能自动删除"啊""嗯"的Gemini 3.5 Transcribe,OpenAI则有GPT Transcribe和GPT Live Transcribe两款产品。加上
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.