咱平时开会、采访、上课,最烦的是啥?是把一小时录音整理成文字。好不容易转出来,满屏都是"嗯""那个""呃",还有说错又改口的半句话,电脑抄字抄得挺费劲,可抄出来根本没法直接用。
谷歌好像听懂了这个痛点。8月26日,它推出了一款新的语音转文本模型,名叫Gemini 3.5 Transcribe,并且被官方称作迄今"最精准"的一代。
![]()
可别把它当成普通语音转文字工具。过去那些工具是"逐字记录",你说什么它抄什么,连口头禅和口误都一并抄下来。而这次谷歌明显想更进一步——让机器"理解式转写",也就是说,模型不光听声音,还得琢磨你想表达的意思,然后替你把乱糟糟的口语收拾干净。举例来说,它能自动删掉"嗯""呃"这类语气词,还能识别出"我刚说错了,其实是……"这种自我修正,最后给你一段排版规整、读起来顺口的文本。
![]()
翻译软件翻译不了错话,但新模型专门处理这些。据公开数据,它在流式(实时)场景下的平均词错率约为4.0%,在非实时(处理录好的音频)场景下能降到2.6%;相比上一代语音模型Chirp 3,转写耗时缩短了约70%。
在覆盖面这块,它支持85种以上的语言和地区方言,可以自动识别说话人、最多区分三名说话者,实时版本延迟还能控制在1秒内。开发者还能上传自定义词汇表,专门提高某些专业术语的识别率。
![]()
发布至今,这个模型已经悄悄进了不少地方:比如安卓系统的Gboard输入法和Mac上的Gemini应用,未来还计划接入Chrome浏览器。开发者和企业则能通过Gemini API提前体验,实时流用Live API,处理录制好的录音则用Interactions API;每小时录音的费用大约在0.30美元左右。目前在Google AI Studio和Gemini企业平台上还是公开预览阶段。
![]()
从行业角度看,这次发布释放的信号很明确:语音转文字早已不是"帮忙打字"的小工具,而是正在变成人和AI打交道的重要入口。谷歌把它和Gemini 3.5 Live放在一起组成"Gemini Audio"系列,还打算塞进Chrome、Docs这些高频产品里,背后的算盘其实是让"说"成为最自然的指挥方式。
当然,新能力也有争议。正因为模型会"替你润色",它可能改动你原本的原话——如果场景要求一字不差(比如法律文书、重要会议记录),眼下它更适合当个聪明的速记员,而不是负责存档的官方记录。这也是所有"理解式转写"绕不开的边界问题。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.