谷歌推出新一代语音转文字模型
谷歌日前宣布推出 Gemini 3.5 Transcribe 模型,这是该公司最新研发的语音转文字模型,重点提升实时转写准确率、降低延迟和提高多语言能力。与传统语音识别不同的是,该模型不仅负责将语音转换为文字,还会理解说话者的意图并对结果进行自动整理和格式化。
![]()
目前该模型已经通过 Gemini API 平台进行公共预览,开发者可以在控制台进行调用。Gemini for macOS 版用户也可以使用该模型,在 macOS 版中用户可以直接通过语音要求 AI 分析本地文件、改写文本和生成图片等。
自动处理停顿、自我纠正和口头语
Gemini 3.5 Transcribe 可以自动处理停顿、自我纠正和口头语。例如用户说「明天见——不,改成后天」,模型会直接输出修正后的最终内容,同时自动去除嗯啊等无实际意义的填充词。
用户还可以提供自定义词汇表,让模型识别产品名称、专业术语和特殊拼写,减少技术会议、医疗和企业客服等场景中的转写错误。这一设计直接面向实际业务场景,帮助降低因专有名词识别不准带来的沟通成本。
支持超过85种语言并区分说话者
模型支持自动识别和转写超过 85 种语言,针对地区口音和方言进行优化。处理预录音频时,模型还可以区分最多 3 名说话者并标注发言归属,同时提供单词级别的时间戳;超过 3 名说话者目前处于实验性支持阶段。
![]()
这意味着在会议录音、电话记录等多人对话场景中,转写结果可以更清晰地呈现谁在什么时间说了什么,而不只是一段连续的文字流。
实时模式延迟低于1秒,错误率大幅下降
Gemini 3.5 Transcribe 提供实时模式 API 和预录制模式 API。前者通过 Live API 持续进行双向流式转写,延迟低于 1 秒;后者主要面向会议录音、电话记录和其他预录制音频的转文字能力。
谷歌称该模型实时转写平均词错误率仅为 4%,非实时模式错误率仅 2.6%,最终转写结果生成时间要比此前的语音转文本模型缩短 70%。从这三项指标看,新模型在准确率和响应速度上都有明显提升。
未来将支持 Chrome 浏览器
谷歌也确认未来该功能将支持 Chrome 浏览器,届时用户可以直接在网页输入框中使用自然语音完成文本内容的输入和编辑。这意味着语音交互将从独立应用逐步延伸到日常网页操作中。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.