谷歌发布了语音合成模型Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。前者面向高复杂度处理,后者面向大批量任务。两个模型覆盖100多种语言和方言,可调用的音色超过2000种。
这不是一次常规的版本迭代。从官方博客到第三方评测,几个数字值得单独拎出来看:在Artificial Analysis的发音鲁棒性基准上,Gemini 3.8 Flash TTS首发即排名第一;在Provider Voice Arena排行榜上位列第二。在Hume AI的语音AI基准测试中,它拿下了综合评分第一。
![]()
两个模型,两种用法
![]()
Gemini 3.8 Flash TTS的定位是"从零造声"。用户可以用自然语言提示词描述想要的声音,模型据此生成全新的音色,适用于游戏、有声书、播客等场景。官方演示视频里,当用户提出"想要更低沉的声音"时,AI会据此给出调整后的语音方案。
Gemini 3.8 Flash-Lite TTS则瞄准批量处理需求。两个模型的分工很清晰:一个负责质量和创造性,一个负责吞吐量。
另一个功能是声音复现。用户录入30秒的音频样本,模型就能用这个声音朗读任意文本。但这项功能附带一道门槛:必须获得说话者本人的同意。这意味着直接拿电影或动画里的配音片段输入、复现原声,走不通。
长音频与多人对话
连续数小时的语音输出中,模型能维持音质、自然语速和角色音色的一致性。它还能表现多人对话场景,以及笑声、叹息、附和等反应性语气。这些能力指向的是有声书、播客、游戏配音这类需要长时间稳定输出的内容形态。
![]()
在Voice Arena的人工评选中,该模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语等语种上排名靠前。多语言表现不是靠英语单点突破,而是分语种都有位置。
安全与体验入口
所有生成的音频片段都会嵌入SynthID水印,这一措施与Gemini Audio系列模型保持一致。水印的作用是标记AI生成内容,便于后续识别。
两个模型目前可在Google AI Studio中体验。
从产品逻辑看,谷歌这次把TTS拆成了两条线:一条走质量上限,一条走成本下限。声音复现加同意机制,是在功能开放和滥用风险之间划的一条线。至于这条线划得够不够紧,得看实际使用中的执行力度。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.