谷歌给Gemini Audio装上了新的Gemini 3.5系列模型,这次重点升级的是语音转文字能力。新模型可以自动识别专业术语,覆盖超过85种语言,并且在背景噪音或说话被打断时也能保持稳定表现。
这次一共推出三个版本:Gemini 3.5 Live、3.5 Live Experimental和3.5 Transcribe。其中3.5 Transcribe是全新成员,专门负责把语音转成文字。谷歌称它相比上一代转写模型Chirp 3有“重大进步”,尤其是在多语言表现和用词错误率方面。
![]()
自动清理语气词和填充词
3.5 Transcribe最直观的变化是,它会把“嗯”“啊”这类填充词直接从转写结果里删掉。用户还可以给模型提供自定义词汇表,让它按照特定的拼写要求或专业术语来转写,减少手动修改的麻烦。
对于预先录制的音频,这个模型还能区分最多三位说话人,并给出词级时间戳。谷歌的说法是,用户可以用语音“自然地编辑”文本,转写结果会自动排版。
实时语音模型同步更新
另外两个模型也在同步升级。Gemini 3.5 Live在处理句子中途被打断、语言识别和实时视觉处理上有所改进。Gemini 3.5 Live Experimental则更进一步,会在处理复杂推理任务时,实时逐步说明自己的进展。
这些更新从今天开始向所有macOS版Gemini应用用户推送英文版本,Android端的Rambler听写功能也会在部分国家和语言上线。开发者可以通过AI Studio和Antigravity在Gemini API的公开预览中调用这些模型。
Gemini 3.5 Pro仍未露面
值得注意的是,谷歌此前承诺在6月推出的Gemini 3.5 Pro至今还没有发布。这次音频模型先行落地,算是给等待中的用户一个阶段性交代。谷歌还提到,Chrome浏览器的支持也即将到来。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.