语音合成赛道又换老大了。Artificial Analysis 的 Provider Voice TTS Arena 榜单上,ElevenLabs 的新模型拿下第一,Elo 得分 1,319,成绩区间 +19/-19,累计出场 1,674 次。
排在它身后的是 Cartesia 的 Sonic 3.6,Elo 1,276;再往后是 Google 的 Gemini 3.8 Flash TTS,Elo 1,267。三个模型的差距不算悬殊,但这款新模型是唯一一个在四个细分场景里全部排第一的选手。
![]()
四个场景全拿第一
这四个场景分别是客户服务、助手、知识分享和娱乐。它在每一个类别里都排在榜首,没有出现"偏科"的情况。
换句话说,不管是做客服机器人还是做有声内容,这个模型在评测里都没有明显短板。对于需要跨场景复用一个语音方案的团队来说,这一点比单纯的 Elo 分数更有参考价值。
这是 ElevenLabs 最新的文本转语音模型,语言支持从上一代的 70 多种提升到了 90 多种。
换个声音再比一次,它排第二
Provider Voice 比的是各家自己的声音。为了排除"声音本身好听"这个变量,榜单还设了一个 Controlled Voice 维度——所有模型统一使用同一个自定义声音来对比。
在这个维度下,新模型排到了第二,Elo 1,157(+16/-16),出场 1,483 次。第一名是阿里巴巴的 Qwen-Audio-3.1-TTS-Plus,Elo 1,178。
上一代在同一个维度下的 Elo 是 1,073,新一代比它高出了 84 分。这说明进步不只来自声音库的扩充,模型本身对音色的还原能力也在往上走。
91.7%,榜单测过的最高分
发音鲁棒性这一项,新模型拿到 91.7%,是这份榜单测量过的最高分。
作为对照,Gemini 3.8 Flash TTS 是 89.5%,Gemini 3.1 Flash TTS 是 88.2%。上一代的成绩是 85.6%,新一代提升了 6.1 个百分点。
发音鲁棒性衡量的是模型在多语言、复杂词、专有名词等场景下读对音的能力。这个指标越高,意味着实际部署时因为读错字而需要人工返工的情况越少。
快了一截,但也贵了一截
速度方面,新模型每秒钟生成时间可以处理 73.4 个字符,上一代这个数字是 42.5。生成效率提升了大约七成。
成本方面,新模型的定价是每百万字符 80 美元。Sonic 3.6 是每百万字符 49 美元,Gemini 3.8 Flash TTS 是每百万字符 16.49 美元。
把这几项放在一起看,新模型的位置比较清楚:发音准确率和生成速度都是它的强项,代价是单价明显高于两个主要竞品。选它还是选更便宜的方案,取决于具体场景里读错一个字的成本有多高。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.