5秒。只要5秒的音频,一台普通笔记本就能复制出你的声音。这不是实验室里的演示,而是一个已经能下载安装的开源工具。更让人不安的是,整个过程不需要任何身份验证。
几个月前,Kyutai发布Pocket TTS时,我用一段5秒的录音克隆了自己的声音。那次体验让我开始怀疑,银行和保险公司赖以生存的声纹验证到底还剩下多少可靠性。门槛低到任何一个有电脑、能上网的人都能复现同样的结果。
![]()
几个月后,同样的流程有了专门的桌面应用。它叫Voicebox,支持Windows、Linux和macOS,安装是点下一步式的,生成效果比之前更逼真,而且全部跑在消费级硬件上。
它到底是什么
Voicebox是一个开源、免费的声音工作室,作者是Jamie Pine,他是Spacedrive Technology Inc.的创始人。它采用MIT许可证分发,定位是两款付费服务的本地替代品:一个是做声音克隆和文本转语音的ElevenLabs,另一个是做听写的WisprFlow。因为是开源的,所有运算都在你自己的硬件上完成,使用它不需要注册账号。
核心功能自然是声音克隆。用户可以通过上传音频文件、麦克风录制,或者直接抓取电脑上正在播放的声音来建立声音档案——包括YouTube视频或Spotify播客里的音频。建好档案后,它内置的五种语音引擎,包括阿里巴巴的Qwen3-TTS和Resemble AI的Chatterbox,可以用这个声音朗读任何输入的文字,支持多达23种语言。
围绕克隆功能,还有一整套工具:多声音项目的时间线编辑器、效果器机架、由Whisper驱动的系统级听写,甚至还有一个本地API,让编程助手用克隆出来的声音跟你对话。
它有大量正当用途。这个工具面向有声书和播客制作、游戏NPC对话、语音助手以及各种无障碍功能。但同样明显的是,恶意使用的空间也不小。Spacedrive的条款承认,它的声音归属检查是有限的,而且不覆盖桌面应用本身。这意味着,没有任何东西能阻止一个人克隆他人的声音,并在没有托管服务通常具备的防护措施的情况下随意使用。
它是怎么跑起来的
底层上,Voicebox本质上是一堆本地语音模型的桌面封装。给它一段声音样本,Whisper先做转写,然后Qwen3-TTS这类语音引擎利用音频和转写文本生成该声音的新语音。听起来复杂,但应用的界面让操作变得非常简单。运行它唯一需要的技能,就是会开机和会点安装向导。
Voicebox官网称,最少3秒音频就足够完成克隆,但文档建议用10到30秒的干净语音以获得最佳效果。无论如何,对于任何有公开声音的人来说,这个门槛低得离谱——一段YouTube采访、一期播客,甚至一条Instagram短视频里,都能找到大量可用音频。这也让接听陌生来电变得比平时更危险,网络攻击者只需要录下你几秒钟的声音就能克隆它。
硬件门槛同样不高。最低要求是8GB内存、5GB存储和多核CPU,推荐配置也不过是16GB系统内存,最好有一块Nvidia显卡。我2022年买的联想Legion 5 Pro笔记本就已经满足这些规格,测试就是在这台机器上完成的。
补丁说明里还埋着两个值得留意的细节。从0.4.5版本起,缓存过的模型可以在没有网络连接的情况下生成语音;最新的v0.5.0版本可以追溯到4月。一旦所有内容下载完毕,你和生成的声音之间就没有任何东西阻隔——这一点我亲自验证过。
三步完成,简单得令人不安
最新版Voicebox提供三种克隆声音的方式:上传已有片段、通过麦克风录制,或者抓取电脑上正在播放的声音,录制和抓取都限制在30秒以内。接着你需要提供录音的转写文本,然后基本就结束了。没有身份检查,没有归属声明,档案页面上也没有任何地方询问这个声音是否真的属于你。
首次运行前,我需要下载两个东西。第一个是Qwen3-TTS 1.7B,大约3.6GB。第二个是笔记本RTX 3070 GPU专用的CUDA后端,因为Nvidia加速并没有随应用打包。两个装好之后,从录制样本到生成克隆语音,整个过程不到5分钟。
至于结果,模型对我声音特征的还原程度令人着迷。节奏、音高和音色都被带进了一句我从未说过的话里,只有几处瑕疵能暴露它不完全是我。有趣的是,当我把样本
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.