谷歌提前放出3.5系列新模型
在外界仍等待Gemini 3.5 Pro发布之际,谷歌先推出了3.5系列中的另一款模型。该公司今日发布了Gemini 3.5 Transcribe语音转文本模型,这是一款旨在优化语音输入体验的AI模型,能够自动删除语音中的“嗯”“呃”等口头禅以及说错后自行纠正的内容,最终生成更加通顺、整洁的文本。
![]()
这款模型目前已经为Pixel 11上Gboard键盘的“Rambler”功能提供支持,接下来还将陆续进入谷歌旗下更多产品和服务。
速度提升约70%,错误率降至5.5%
谷歌表示,与此前名为Chirp 3的语音转文字引擎相比,Gemini 3.5 Transcribe在速度和准确性方面都有提升。从用户说话到最终生成转录文本,整体速度预计可提升约70%;在实时语音场景下,其错误率已经降至5.5%。
不过,准确率的提升幅度并不算特别大。按照谷歌的数据,Chirp 3的错误率为7.32%。但对于经常使用语音输入的用户来说,即便只是少打几个错字,也意味着后续需要手动修改的内容更少,因此依然是一项实用的改进。
不只是“听清楚”,还要理解用户想表达什么
Gemini 3.5 Transcribe的能力也不只是“听清楚”用户说了什么,它还试图理解用户真正想表达的意思。在说话过程中,模型可以自动删除“嗯”“呃”等影响语句流畅度的口头禅。如果用户说错话后立即进行修正,它也能够实时调整已经生成的文本。此外,用户还可以提供自定义词汇表,让模型更好地识别专业术语和特定领域的词汇。
该模型目前支持85种语言,并且可以处理最多包含3名说话者的预录音频。
智能润色未必适合所有场景
当然,这种功能也存在一个明显的问题:用户需要相信AI能够准确理解自己真正想表达的内容。至少在较短的文本中,从Rambler功能的实际体验来看,模型确实能够较好地清理前后不一致的表达和说话时的磕绊,让文本看起来更加自然。
但与此同时,Gemini 3.5 Transcribe并不只是简单地把语音转换成文字。AI在整理内容的过程中,实际上可能会改变用户原本的措辞。因此,在一些需要严格保留原话、不能随意修改表述的场景中,这种“智能润色”未必适合使用。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.