原本只是“能说话”的语音助手,现在开始学着“表达”。通义实验室扔出了Qwen-Audio-3.0-TTS实时语音合成模型,名字很长,但意思很直接:机器念稿的时代结束了。
这次发布分了Flash和Plus两个版本,核心突破在于用自然语言指令直接控制语音输出。你不用再像调试老式收音机那样去调参数,告诉它“读得悲伤一点”“换成四川话”“这段用新闻播报的语气”,它能听懂,并且照做。
![]()
更关键的是多语种和方言支持。以前这类模型要么只认普通话,要么英文输出带着一股塑料味。Qwen-Audio-3.0-TTS试着把中英混合、方言切换这些真实场景的坑填上。如果实测效果稳定,那些靠人工标注情绪标签的旧方案,大概率要被掀桌子了。
从“能说话”到“会表达”,区别在于前者只是声波合成,后者开始涉及语气、情绪、语境适配。通义实验室这步棋,瞄准的是语音交互从工具性向人格化的过渡。话说回来,模型归模型,最终落到产品里能不能让用户觉得“这声音像个人”,还得看各家的工程落地能力。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.