大模型的更新,已经从聊天框一路卷到了耳机里。9月23日的2026云栖大会上,阿里发布Qwen-Audio-3.1系列语音大模型,语音转写、语音合成和实时语音交互权限同步升级。其中一款号称音频创作的模型Qwen-Audio-3.1-TTS-Next,引起了不少人的好奇。
按过去的流程,做一段有声书成片,得四个工种接力:主播录对白,音效师找素材,混音师调层次,剪辑师最后拼成完整场景。就算AI已经能把对白生成得像模像样,后面那串活儿一样都省不掉。而这款模型把这些环节放进同一次生成——输入一段脚本,人声、音效、环境声一起出来,连各类声音出场的先后顺序都能编排。
![]()
一个模型,干完了过去一条流水线的活儿。但创作者的需求也的确越来越高:光把一句话念好听已经不够,还得把整个场景演出来。人物的表演、声音的出场顺序、对白和背景声的关系,都成了模型要交的作业。
声音好听,能不能接住一个梗?情绪到位,换个人物会不会串音?雨声、脚步声都有了,它们是在配合剧情,还是各响各的?带着这些问题,有人给这款音频创作模型准备了一场“声音试镜”:漫剧的反差桥段、播客里的互相拆台,以及AI短片里靠声音撑起来的氛围。
Round 1:都元婴期了,怎么还得上交手机?
第一道题,是一段修仙喜剧。灵感来自最近很火的漫剧《我都元婴期了,你跟我说开学》。满级大佬重回新手村,充满了荒诞和无奈感:主角在修仙界苦修两千年,成就元婴期修为,结果一回到地球,发现时间才过去一个暑假,自己还得像个普通大一新生一样去开学。
沿着这种反差,测试者另写了一段小剧场(原创台词,非原剧节选):
- 【修士】:闭关三百年,今日,本座终于——
- 【老师】:手机交一下。
- 【修士】:此乃传音法器。
- 【老师】:法器也不能带进考场。
- 【修士】:本座渡过九重雷劫。
- 【老师】:那正好,这张卷子也是九道大题。
- 【修士】:……能补考吗?
境界很高,考场地位很低。这段戏的包袱不复杂,但要单靠声音把它演好,很有难度。修士出场时得有一股“终于轮到本座了”的气势,老师则最好平静到连眼皮都懒得抬。
为了保留原角色的感觉,测试者上传了原角色的30秒音频作为声音参考,再把新台词、表演要求和声音设计一起交给Qwen-Audio-3.1-TTS-Next。不到一分钟,一段约27秒的音频就生成了。
这次生成最出彩的地方,是角色熟悉的音色与新台词里的表演能同时保留下来。人物音色的还原度很高,音效、背景音和语气词也融合得自然。即使只有不到30秒,听感上已经具备了漫剧片段的完整性——人物在前面演,其他声音跟着共同营造气氛,融合得刚刚好。
对创作者而言,这种设计的直接价值,是能围绕同一段剧情组织声音,减少分别配音、寻找音效、再逐项拼接的操作。当然,这次完成的是音频,配进视频后的镜头节奏仍需检查。但作为一段新剧情的声音初稿,它已经足够惊艳了。
Round 2:让AI聊“活人感”,谁先绷不住?
修仙漫剧可以靠鲜明的角色和音效撑起戏剧感,换到播客,没有音效替人物造势,几个人坐在麦克风前是否还能聊得自然呢?
最新一期《没理想编辑部》的播客聊的是这样一个话题:活人感是新的伪人感。让AI唠出活人感,有点强“模型”所难,但本着给千问语音模型上点强度的心态,测试者还是决定试试。
这一段考的是把表演痕迹收起来。测试者给三个人分配了不同的声音和表达方式:A认真解释,B一本正经地拆台,C在旁边听着,冷不丁补上一句。背景只留轻微的声响,把注意力放在人声上。这次没有给AI任何角色参考音频。
从技术能力看,这组测试同时考察了多人声音的一致性和上下文中的表达控制。角色每次开口都要保持可辨认的音色,情绪和停顿又要随着对话变化。
这三个“人”听起来真有点“熟”。有人话还没说利索,旁边就接上了;有人忍着笑解释,另一个人顺嘴拆台。句尾轻重收放自然,连带笑说话时那点含混,确实像几个朋友聊到兴头上。就连提示词中要求AI加入轻微的方言感,模型也处理得恰到好处。
答案是:三个“人”的声音都是Qwen-Audio-3.1-TTS-Next生成的。
Round 3:AI志怪短片的悬疑感,能从声音里单独成立吗?
最后一轮,难度再往上提。这一轮想听的是,声音能否独自撑起一个悬疑场景。
测试者写了一段原创志怪短剧:深夜,一个年轻人搭上末班渡船。船夫告诉他,离岸之后,无论听见谁叫名字,都不要答应。偏偏这时,岸上传来了母亲的声音。不用先解释谁是妖、谁是鬼。一个熟悉的声音,出现在不该出现的地方,故事就开始了。
- 【船夫】坐稳。离了岸,谁叫你,都别应。
- 【年轻人】要是家里人呢?
- 【船夫】尤其是家里人。
- 【岸上女人】小远——饭都凉了,怎么还不回来?
- 【年轻人】妈?她怎么找到这儿了……
- 【船夫】别回头。你听,她在岸上走。
- 【年轻人】那怎么了?
- 【船夫】船都划出去这么远了,脚步声怎么还在你耳边?
- 【女人,近处】问你话呢,怎么不应啊?
这段戏把最难的任务交给了母亲。她的声音首先得让人想答应,要像日常生活里听过的那一句。等她再次开口,音色仍然熟悉,距离却近得不对劲。老船夫则承担着另一层变化:苍老、略沙哑的声音,要展现出该有的阅历感,话少,却笃定。
这段测试给模型出了一道更细的题:同一个母亲,从岸边喊人,到站在身旁说话,声音该变什么,又不能变什么?不能变的是人物身份,听众需要立刻认出;要变的则是发声方式和距离感。这就把考题从生成一个像母亲的声音,推进到了同时改变她的表达和所处空间。
另一层难度在于,几种声音需要建立一致的空间关系。水声说明船还在移动,脚步却持续靠近,两者放在一起,才构成故事里的异常。脚步单独听有多逼真,并不足以决定这段戏是否成立;它必须出现在合适的时机,并与其他声音形成对照。对创作者而言,能实现这一点,就意味着可以围绕剧情安排声音,让环境声承担线索,而不只是铺一层气氛。
能听懂、能创作、能聊天之后,语音还能做什么?
回头看这三轮声音试镜,考察的其实是Qwen-Audio-3.1-TTS-Next的三种能力。修仙漫剧要求复刻角色音色与情绪转折;三人播客考验角色区分和对话的自然感;志怪短剧则进一步考验人声与环境声的时序、距离和叙事配合。
从这次样本看,千问语音模型在角色音色、口语表达和场景融合上都有不俗表现,几项能力已经能够共同支撑一段完整的声音作品。它们共同指向一种变化:创作者可以直接描述想要的场景,让模型先把它变成听得见的版本。
这并不意味着创作已经可以一键完成。播客的接话间隔、人物的情绪层次,都经历过调整。但对个人和中小团队而言,能够更快听见初稿,再判断哪里不对、如何修改,本身就降低了尝试的门槛。过去需要先找声音、凑素材、做拼接才能验证的想法,现在可以更早进入试听和打磨。
如果把视野放到整个Qwen-Audio-3.1系列,这种变化还有更大的延伸空间。按照此次发布的信息,ASR语音转写、TTS语音合成和Realtime实时交互三条线都在同步升级:
- 转写端增强上下文理解,并支持去除语气词、重复表达等润色处理;
- 创作端让同一音色在跨语言合成时依然能保持自然感;
- 实时交互端则支持边听边说、随时打断,以及调用工具执行任务。
当这些能力接进同一个应用,一个创作者可以口述故事,让AI整理成脚本,生成一版声音小样,听到不满意的地方直接说“这里先别急着接话”。犹豫、改口、补充条件,本来就是人说话的方式,机器迁就人的节奏,比人迁就机器舒服得多。具体体验取决于产品怎么串联,但技术拼图已经基本备齐。
从这个角度看,阿里Qwen-Audio-3.1的意义已经超出声音更像真人。能听懂、能创作、能聊天,正在让语音成为连接人、内容与AI的自然入口。当一句话既能表达需求,也能开启创作、推动事情往下走,语音才真正从一种输入方式,变成了与AI协作的方式。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.