10秒音频,就能克隆一个人的声音。ElevenLabs 周一发布的 v4 和 v4 Turbo,把这件事的门槛又往下砍了一截。
官方说法是,v4 系列用上了全新架构,语音控制更精细,声音克隆速度更快。去年发布的 v3 已经能靠内联标签设定情绪,到了 v4,标签可以叠加使用,模型会按标签的先后顺序执行。
![]()
从70种语言到90种
旧版模型支持 70 种语言,v4 把数字提到了 90 种。ElevenLabs 特别点出,日语、巴西葡萄牙语、普通话和粤语的合成质量提升最明显。
内容创作场景里,新版模型朗读大段文本时能更好地维持说话人的音色特征,朗读过程中还会记住前后文语境,跟着调整语气。这两点对做有声内容的人来说,比多支持20种语言更实在。
语音智能体才是主战场
过去一年,ElevenLabs 的企业语音通话业务扩张很快,目前超过 55% 的业务收入来自大型企业。新模型明显是冲着这个场景去的。
官方列了几个适配点:
- 延迟更低,对话体验更流畅
- 后端大语言模型刚开始输出回答时,v4 就能同步生成语音音频
- 能差异化处理争执对话、诉求升级、通话等待这几类场景
最后一条值得多看一眼。争执和诉求升级是客服通话里最难处理的部分,模型能识别并区别对待,说明它不只是把文字念出来,而是在理解通话的走向。
钱和人都到位了
今年早些时候,ElevenLabs 从红杉资本拿到 5 亿美元融资,投后估值 110 亿美元。目前有传闻称公司正在筹备新一轮融资,目标估值可能达到 220 亿美元。
营收跑得更快。年化营收运行速率从年初约 3.3 亿美元攀升到 6 亿美元以上。公司在印度、欧洲、巴西等市场大举招人,员工总数已突破 800 人。
联合创始人兼 CEO 马蒂·斯坦尼舍夫斯基在接受 TechCrunch 采访时说,公司计划“未来几年内”完成 IPO,但没有给出确切时间点。
从 70 种语言到 90 种,从 3.3 亿到 6 亿美元,从 110 亿到传闻中的 220 亿估值——这家公司的节奏,比它合成语音的速度还快。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.