![]()
谷歌于2026年8月26日正式推出名为"Gemini Audio"的全新语音模型系列,包含三款产品:Gemini 3.5 Live、Gemini 3.5 Live Experimental以及Gemini 3.5 Transcribe。该系列模型旨在为用户提供更自然、更流畅的实时对话与语音识别体验。
Gemini 3.5 Transcribe是谷歌迄今最精准的语音转文字模型,将取代此前的Chirp 3模型。该模型具备智能转写功能,可自动去除"嗯""啊"等口头禅,并通过语音指令完成文本编辑与格式化。在性能表现上,Gemini 3.5 Transcribe在流式音频场景下的词错误率(WER)为4%,在预录制文件场景下低至2.6%,即便在背景噪音和复杂对话环境中也能保持较高准确率。此外,该模型支持85种以上语言的自动检测与转写,涵盖多种区域口音和方言,并可识别最多三位说话者的语音内容。用户此前已通过Gboard的Rambler功能体验到这款模型,未来该模型还将登陆Chrome浏览器,支持在任何网页输入框中进行语音输入。
Gemini 3.5 Live与Live Experimental两款模型则专注于实时交互体验。Gemini 3.5 Live能够处理对话中的中途打断,实时处理视觉画面,并支持多语言无缝切换,用户无需暂停对话即可完成各种操作。Live Experimental版本进一步增强了复杂任务处理能力,可在对话过程中直接进行推理,并逐步向用户展示其思考过程。
在部署方面,Gemini Audio系列模型正在向Search Live、Gemini Live、Docs、Keep、Gmail、Gemini应用以及Gboard等平台全面推送。开发者可通过Google AI Studio和Google Antigravity调用Gemini API使用这些模型,而企业用户则可在Gemini Enterprise Agent Platform和Gemini Enterprise for Customer Experience平台上获取相关服务。
参考链接:
https://www.androidauthority.com/google-introduces-gemini-audio-3703443
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.