在 Cartesia 的 playground 里,Elvis Saravia 上传了大约 15 秒自己的录音。几秒钟后,一个能开口说话的"他"就出现了。
他让这个克隆声音说了一段日语。那是他本人不会讲的语言。
![]()
支撑这次尝试的是 Cartesia 最新的语音模型 Sonic 3.6。据他实测,该模型支持 44 种语言,克隆过程在几秒内完成。
Saravia 给出的判断很直接:这类能力可以让内容触达更多语言的受众。一个只会说英语的创作者,不必先学会一门外语,也能让自己的声音出现在另一种语言里。
从操作路径看,门槛被压得很低——一段十几秒的样本,一个浏览器里的 playground,剩下的交给模型。真正需要重新想的,是"这是谁在说话"这件事本身。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.