按住下方图标,点击小程序
免费领取AI学习资料、精选提示词
阿里巴巴的通义千问实验室刚刚发布了一个王炸语音模型Qwen-Audio-3.0-TTS,支持16国语言和20种国内地方方言。
在文本内容跟声音对得上、音色克隆够像、说话韵律听着自然、降低AI味等方面做的非常出色,已经是目前顶级语音模型之一了。
![]()
API地址:https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide?spm=a2c63.p38356.help-menu-2400256.d_0_3_4_0.2cba607a2xcpQu
咱们先直接听几个地方方言吧,反正我是没怎么听出来AI味,在语调、音色细节方面处理的非常棒,。
四川话:天天加班,身体硬是吃不消。干脆辞职算了,自己开个面馆当老板,还自由些。
东北话:咱给大舅捎点啥礼啊?整两瓶好酒呗,要不空手去多丢份儿啊,让人笑话。
杭州话:你格个操作真个是作孽,表去送了。赶紧抱我大腿,带你赢一把。
重庆话:大热天的空调坏了,打电话给售后一直喊我等,屋头热得像蒸笼,我人都快遭烤干了。
河南话:哎呀,何解突然间停电哒咯?我冷水澡洗了一半,一身的肥皂泡泡,硬是造孽死人去!
怎么样上面语音很惊艳吧。咱们接着料聊Qwen-Audio-3.0-TTS有意思的技术细节。
很多人不知道,AI配音卡顿、延迟高、音色失真,根源大多在底层的解码架构上。这次新版本最大的底层优化,就是用上了低帧率语音分词技术。
简单理解就是,AI不用逐帧反复运算发声细节,在完整保留人声音色、文本语义的前提下,大幅减少计算量,直接降低推理延迟,响应速度变得特别快。
为了让发声更自然、适配场景更广,研发团队还设计了五阶段渐进式训练流程。
先是让语言模型和声学模型各自先打好底子,然后用高质量数据把俩模型拧到一块联合训练;
![]()
接着用强化学习给语言模型调调味,再专门针对那些特别恶劣的输入场景练声学模型的抗造能力,最后再来一轮强化学习微调收尾。
这么一圈走下来,内容匹配度、韵律自然度、音色还原度、听觉音质、包括那些噪音混响特别严重的场景,全都能照顾到。
控制这块特别合日常使用场景。以前调语音参数多费劲,什么频率啊增益啊,普通人哪搞得懂。
现在好了,直接拿自然语言描述就行,例如,提示词:这人设是活泼小姑娘还是沉稳大叔,情绪是开心还是难过,语速快点慢点,带不带口音,统统用大白话写出来。
再往细了说,还多了86种行内标签,能精确控制到某个词或者某个字。
想让那句台词突然带点笑意,或者中间加个呼吸声、咳嗽声、叹气声,甚至让情绪从平静慢慢过渡到激动,全都办得到。这种细腻程度,做有声读物或者角色配音的时候特别实用。
语言方面覆盖了16种,阿拉伯语、印尼语、葡萄牙语、泰语、越南语、马来语等。
![]()
更绝的是汉语方言,覆盖了20种,爆款东北、四川、重庆、河南、山东等语言。
最后说说长文本和文本处理能力。这事看着小,其实特别考验基本功。
做过长文本配音的朋友都懂,多数AI模型读几百字就会出现断句混乱、语速忽快忽慢、情绪断层的问题。
Qwen-Audio-3.0-TTS完美解决了这个痛点,支持单次不间断生成最长三分钟的连续语音。不管是大段散文、小说节选、长篇文案,全程韵律稳定、断句自然、音色统一,不会出现中途崩坏的情况。
除此之外,文本归一化能力也很能打。面对数字、时间、特殊符号、专业缩写、各类数据参数,都能精准、标准地朗读出来,不会出现读错数字、乱念符号的低级错误。
不管是播报数据、朗读专业文案,还是日常内容配音,准确度都拉满,完全能满足商用标准。
![]()
我觉得Qwen-Audio-3.0-TTS这次最大的突破,就是让AI配音彻底脱离了机械工具属性。
不再是单纯的文字转声音,而是能读懂情绪、适配场景、兼顾细节、适配多语言的真人级语音生成工具,也是目前最适合普通用户和商用落地的顶尖配音模型。
AI 实操交流群找一群同路小伙伴一起进步
企业、高校及渠道合作
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.