阿里巴巴最新推出的通义千问音频模型Qwen-Audio-3.0-TTS-Plus,在Artificial Analysis的Speech Arena排行榜上以1236的ELO评分,力压Simba 3.2的1234分摘下榜首,Gemini 3.1 Flash TTS和Sonic 3.5分别以1214分和1207分落后。该模型提供两个版本:Flash版延迟约300毫秒,主打实时交互;Plus版则专攻高品质语音输出。它支持包括他加禄语、马来语、泰语、越南语在内的16种语言及多种汉语方言,用户可直接用自然语言指导说话风格,或插入“[angry]”“[giggles]”等标签添加非语言提示。阿里还表示,在声音克隆时,该模型对嘈杂或回声重的参考录音比以往版本更稳健。然而其输出速度仅每秒16个字符,远逊于Sonic 3.5的120字/秒和Simba 3.2的30.2字/秒,成为明显短板。该服务通过阿里云模型工作室定价为每百万字符27.60美元。质量与速度的巨大落差,或许正是开发者需要权衡的核心冲突。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.