30秒的录音,就能生成一个属于你的声音。谷歌今天发布了两款新的语音合成模型——gemini-3.8-flash-tts 和 gemini-3.8-flash-lite-tts,随模型一起放出的,是一个超过 2000 种音色的声音库。
官方给出的自定义声音门槛是:只需要一段 30 秒的音频样本,前提是你本人声音,或者你拥有合法使用权的声音。这个时长,比大多数人录一条微信语音还短。
![]()
多角色对话,是这次 API 的显眼功能
两款模型里,一个被反复提到的能力是:定义多个角色之间的完整对话。每个角色可以分配不同的音色,还能各自带上声音风格的指令。换句话说,一段多人对白不需要分别合成再拼接,在 API 层面就能一次定义清楚。
有人用 GPT-6 Astra 写了一个自带密钥的试玩界面,直接调用了 Gemini API 开放的 CORS 策略。演示片段是一段两只鹈鹕的对话,争论要不要搬到 Pacifica Pier——脚本由 Claude 4.5 Opus 撰写,并生成了一个调用该工具渲染的链接。
成本账:1分18秒,2.74美分
这段演示的实测数据是:用 Gemini 3.8 Flash TTS(不是更便宜的 Flash-Lite)生成 1 分 18 秒音频,耗时约 20 秒,花费 2.74 美分。
把生成速度和成本放在一起看,这个组合对做播客、有声内容、游戏对白的团队来说,意味着试错成本被压到了几乎可以忽略的量级。一段一分多钟的成品,成本不到三美分。
正反两面的判断
支持的一方看的是效率:2000 种音色打底,30 秒样本做定制,多角色对话一次成型,再加上按秒计费的低成本,语音内容的制作门槛被拉到了新低点。过去需要录音棚和配音演员的活儿,现在一段脚本加几次 API 调用就能出小样。
谨慎的一方盯的是那条 30 秒的线。声音克隆的门槛越低,滥用空间就越大——模型方给出的约束是"你的声音,或你有权使用的声音",但这条边界在实际调用中如何被守住,目前还没有更多机制说明。
两边的分歧其实不在技术能力上,而在同一件事的两面:门槛低到 30 秒,既意味着更多人能用上,也意味着更多人能滥用。谷歌这次把音色库和克隆能力一起放了出来,接下来真正决定它走向的,是使用侧的那条线画在哪里。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.