据科技媒体TestingCatalog 8月2日报道,微软正在内部测试其首款原生实时语音模型MAI Realtime,标志着微软在对话AI领域迈出关键一步。与此前仅支持单向语音合成或识别的MAI系列模型不同,MAI Realtime采用全双工交互设计,允许用户在说话的同时听到模型的回应,而不必等待“你说完我再说”的轮次切换。
这种全双工能力意味着系统可以边听边想边答。它依靠端点检测技术实时分辨用户的说话开始、停顿和结束,当用户中途插话时,模型能即时调整输出内容,不会死板地播报完上一轮生成的全部回应。TestingCatalog披露的界面截图显示,调试面板会展示实时延迟、模型思考内容和处理步骤,向开发者透明化推理过程。
![]()
在语言和声音覆盖面上,MAI Realtime首批支持英语、德语、西班牙语、法语、意大利语、葡萄牙语、日语、韩语、中文、荷兰语、印地语、印尼语、阿拉伯语、俄语、土耳其语、越南语、泰语共16种语言,并配备Victoria和Grant两种语音风格。用户可主动指定对话语言,也可开启自动检测功能,模型将自行识别并在对话过程中无缝切换。测试者反馈其语音自然度明显优于Copilot目前的语音模式,但微软明确将其定位为对话系统——不支持唱歌,也不能生成笑声、掌声等非语音音效。
正向看,全双工实时交互让语音助手更接近人类自然交谈的节拍,减少了用户在某些场景下的等待焦虑。自动语言检测和中途切换设计也降低了多语用户的操作门槛。另一面,功能性局限同样分明:MAI Realtime仍是一个纯对话引擎,无法扩展到带有情感表演或音效合成的娱乐场景。这种“专精”路线是否会被市场接受,取决于后续是否开放微调或插件生态。
目前该模型仅在MAI Playground平台内向部分合作伙伴开放测试,上线Microsoft Foundry及Copilot语音功能的时间尚未公布。回顾微软此前发布的MAI系列模型,均聚焦单向能力——MAI-Voice-2及其Flash版本专攻语音合成,MAI-Transcribe-1.5负责语音识别。MAI Realtime是首次将二者整合到同步交互管道中的尝试,其技术架构的稳定性与延迟表现,将直接影响微软能否在实时语音赛道追上OpenAI、谷歌等对手的步伐。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.