7月20日消息,2026世界人工智能大会(WAIC 2026)期间,阿里巴巴发布新一代语音合成大模型Qwen-Audio-3.0-TTS,在细粒度语音控制、多语种、多方言及复杂声学环境适应等方面实现升级,并推出面向实时交互的Flash版本和面向高质量生成的Plus版本。
![]()
据了解,Qwen-Audio-3.0-TTS-Plus目前已登顶全球第三方评测机构Artificial Analysis语音合成榜单,其预览版Fun-Realtime-TTS也曾于一个月前位列该榜单第一。
与上一代产品相比,新模型进一步提升了语音表达能力。此前,Qwen-Audio系列已支持通过提示词设定“资深客服”“足球解说员”等角色,实现不同情绪、语速及表达风格的切换。本次发布的Qwen-Audio-3.0-TTS新增细粒度标签控制能力,用户可直接在文本中插入[gasp](吸气)、[giggles](轻笑)、[angry](愤怒)等结构化标签,实现对单个词句甚至具体位置的情绪和语气控制,适用于游戏配音、有声书、数字人等场景。
在实时交互方面,Flash版本首包延时达到300毫秒级,可满足智能助手、实时语音交互等应用需求;Plus版本则更加侧重高质量语音生成。
多语种能力方面,Qwen-Audio-3.0-TTS覆盖中文、英语、日语、韩语、德语等16种语言,并新增阿拉伯语、越南语、马来语和菲律宾语等语言支持。
根据CV3-Eval多语种基准测试结果,在16种语言词(字)错误率评测中,Qwen-Audio-3.0-TTS系列在10种语言取得最佳成绩,其中韩语和马来语优势较为明显;在16种语言说话人相似度评测中,Qwen-Audio-3.0-TTS-Plus获得全部16项最佳成绩,Flash版本获得15项第二名。
针对方言表达,新模型通过专项训练优化普通话迁移问题,目前已支持广东、重庆、东北、陕西、上海、四川、云南等20种方言,在韵律、声调及口语表达方面进一步接近母语者发音。
语音克隆方面,Qwen-Audio-3.0-TTS通过真实声学仿真训练,将语音增强能力融入克隆流程,即使参考音频存在较高噪声或混响,也能够过滤环境干扰,保留目标音色,提高复杂环境下的语音克隆效果。
此外,新模型还升级了音频生成质量,内置精品音色库,输出采样率由24kHz提升至48kHz,达到录音棚及影视配音级音质,单次语音合成最长可支持3分钟。
阿里方面表示,目前Qwen-Audio-3.0-TTS Flash和Plus两款模型已正式上线阿里云百炼平台,对开发者开放调用。(定西)
