网易首页 > 网易号 > 正文 申请入驻

Soul App开源播客语音合成模型SoulX-Podcast,支持流畅自然多轮语音对话

0
分享至

近日,Soul App AI团队(Soul AI Lab)正式开源播客语音合成模型SoulX-Podcast。该模型是一款专为多人、多轮对话场景打造的语音生成模型,支持中、英、川、粤等多语种/方言与副语言风格,能稳定输出超60分钟、自然流畅、角色切换准确、韵律起伏丰富的多轮语音对话。

除了播客场景以外,SoulX-Podcast在通用语音合成或克隆场景下也表现出色,带来更真实、更生动的语音体验。


SoulX-Podcast表现

Demo Page:

https://soul-ailab.github.io/soulx-podcast

Technical Report:

https://arxiv.org/pdf/2510.23541

Source Code: https://github.com/Soul-AILab/SoulX-Podcast

HuggingFace: https://huggingface.co/collections/Soul-AILab/soulx-podcast

SoulX-Podcast亮点:流畅自然多轮对话、多方言、超长播客生成

零样本克隆的多轮对话能力

在零样本克隆播客生成场景中,SoulX-Podcast 展现出卓越的语音生成能力。它不仅能高度还原参考语音的音色与风格,更能根据对话语境灵活调节韵律与节奏,让每一段对话都自然流畅、富有节奏感。无论是多轮长时对话,还是情感层次丰富的交流,SoulX-Podcast 都能保持声音的连贯与表达的真实。此外,SoulX-Podcast 还支持笑声、清嗓等多种副语言元素的可控生成,让合成语音更具临场感与表现力。

多语种和跨方言的克隆能力

除中英文外,SoulX-Podcast 同样支持四川话、河南话、粤语等多种主流方言。更值得关注的是,SoulX-Podcast 实现了跨方言音色克隆——即便仅提供普通话的参考语音,模型也能灵活生成带有四川话、河南话、粤语等方言特征的自然语音。

超长播客生成

SoulX-Podcast可以支持超长播客的生成,并维持稳定的音色与风格。

聚焦语音,AI重构情感纽带

一直以来,声音都是传递信息和情感的重要媒介,也最能在沟通中赋予“情绪温度”和“陪伴感”。在Soul,用户积极通过语音实时互动,表达自我、分享交流,收获新关系,语音成为用户构建链接的“情感纽带”,“语音社交”也成为平台颇具代表性的标签之一。

在推进AI+社交的过程中,智能对话、语音生成、情感化表达等语音能力是Soul重点布局的方向。此前,平台端到端全双工语音通话大模型全面升级,并在站内开启内测。新模型赋予 AI 自主决策对话节奏的能力,AI可主动打破沉默、适时打断用户、边听边说、时间语义感知、并行发言讨论等,实现更接近生活日常的交互对话和“类真人”的情感陪伴体验。

同时,团队推出了自研的语音生成大模型、语音识别大模型、语音对话大模型等语音大模型能力,快速应用于“虚拟伴侣”、 群聊派对(多人语音互动场景)等多元场景中。

例如,9月,Soul 的两位虚拟人——孟知时与屿你——在群聊派对中发起了一场持续约40分钟的对话,在没有任何额外投流、仅依靠虚拟人自身自然流量的情况下,这场活动迅速引爆社区,房间互动热度刷新平台纪录,受到了广大用户的热烈欢迎。

这一成功案例让 Soul 的 AI 技术与虚拟IP运营团队深刻意识到:“虚拟IP + AI语音对话” 正在成为虚拟内容生态的重要增长点。它不仅展现了虚拟人的人格魅力与表达张力,更揭示了 AI 在内容创作与社交互动中的全新潜能。

然而,当时业界能够稳定支持多轮自然对话的开源播客生成模型相对较少,并且当场景从单人独白扩展到多人对话与长篇播客时,也普遍面临一些问题。为此,Soul 团队决定开源 SoulX-Podcast, 希望能携手 AIGC 社区,共同探索 AI 语音在内容创作、社交表达与虚拟生态中的更多可能。

开源新阶段,探索AI+社交更多可能

相比传统的单说话人语音合成系统,播客语音合成系统不仅需要保持文本与语音的精准一致,还要具备更强的上下文理解能力,以实现多轮对话间语音衔接的自然流畅与节奏的动态变化。此外,面对多角色交互和超长对话场景,系统还需在音色一致性、风格延续性以及角色切换的准确性上实现更高水平的控制与建模。

近来,已有部分开源研究开始探索播客或对话场景下的多说话人、多轮次语音合成能力。然而,这些工作仍主要聚焦于普通话或英语,对中文受众广泛的方言(如粤语、四川话、河南话等)支持不足。此外,在多轮语音对话场景中,恰当的副语言表达——如叹息、呼吸、笑声——对提升对话的生动性与自然度至关重要,但现有模型对此普遍关注不足。

而SoulX-Podcast正是希望解决这些痛点:不仅支持多轮、多角色的长对话生成,同时兼顾方言覆盖和副语言表达能力,使播客语音更贴近真实交流场景、富有表现力与生动感,从而提升听众的沉浸体验和内容传播力。


整体SoulX-Podcast模型基础结构上采用了常用的LLM + Flow Matching的语音生成范式,前者建模语义token,后者进一步建模声学特征。在基于LLM的语义token建模方面,SoulX-Podcast 以 Qwen3-1.7B 作为基座模型,并基于原始文本模型参数进行初始化,以充分继承其语言理解能力。

尽管SoulX-Podcast是专为多人、多轮对话场景设计的系统,但在传统的单人语音合成与零样本语音克隆任务中同样表现优异。在播客生成任务中,相较于近期相关工作,SoulX-Podcast 在语音可懂度与音色相似度方面均取得了最佳结果。


SoulX-Podcast在播客场景下的表现


SoulX-Podcast在通用TTS上的表现,*官方模型的复现结果

此次 SoulX-Podcast 的开源,是 Soul 在开源社区领域的一次全新尝试,也是一个新的起点。 Soul团队表示,未来将持续聚焦语音对话合成、全双工语音通话、拟人化表达、视觉交互等核心交互能力的提升,并加速技术在多样化应用场景与整体生态中的融合落地,为用户带来更加沉浸、智能且富有温度的交互体验,持续提升个体的幸福感与归属感。同时,团队将进一步深化开源生态建设,与全球开发者携手,共同拓展 AI 语音等前沿能力的边界,探索 “AI +社交” 的更多可能。

责任编辑:韩璐(EN053)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
美国敢“踢”中国出SWIFT?那就强制人民币买中国货

美国敢“踢”中国出SWIFT?那就强制人民币买中国货

看看新闻Knews
2026-04-07 00:42:06
以色列南部遭伊朗导弹袭击

以色列南部遭伊朗导弹袭击

财联社
2026-04-08 05:26:29
复活节的沉默:英国王室信仰天平的倾斜与文明退却

复活节的沉默:英国王室信仰天平的倾斜与文明退却

斌闻天下
2026-04-07 07:30:03
2020年,长沙女子癌症晚期,争夺女儿40万学费,直言:我只想活着

2020年,长沙女子癌症晚期,争夺女儿40万学费,直言:我只想活着

大鱼简科
2026-04-06 11:33:07
丝韵芳香,高跟慢旅的惬意时光

丝韵芳香,高跟慢旅的惬意时光

艾斯莱斯奈斯
2026-04-06 17:04:01
民进党,极有可能在下一届台湾地区选举后,成为长期一家独大政党

民进党,极有可能在下一届台湾地区选举后,成为长期一家独大政党

李橑在北漂
2026-04-02 10:22:26
吓了我一跳!电和天然气烧水,差距居然能差出一个月菜钱!

吓了我一跳!电和天然气烧水,差距居然能差出一个月菜钱!

叮当当科技
2026-04-06 19:32:58
《爸爸4》阿拉蕾长大了!13岁惊人美貌撞脸田曦薇 仙气神颜曝光

《爸爸4》阿拉蕾长大了!13岁惊人美貌撞脸田曦薇 仙气神颜曝光

ETtoday星光云
2026-04-07 11:14:04
伊朗设拉子传出剧烈爆炸声

伊朗设拉子传出剧烈爆炸声

财联社
2026-04-07 12:16:21
掘金18分逆转开拓者,赛后杨瀚森的镜头引热议!他获得约基奇认可

掘金18分逆转开拓者,赛后杨瀚森的镜头引热议!他获得约基奇认可

球场没跑道
2026-04-07 12:28:54
41岁仍拍三级片追求刺激?从亿万富豪再到烂片女王,她在追求什么

41岁仍拍三级片追求刺激?从亿万富豪再到烂片女王,她在追求什么

林雁飞
2026-03-13 12:53:50
法国央行卖出所有在美托管金条 黄金储备战略转移且实现三赢

法国央行卖出所有在美托管金条 黄金储备战略转移且实现三赢

财联社
2026-04-07 11:48:04
恭喜!纽约华人中100万美元,迅速61万现金落袋为安,这张彩票买自唐人街

恭喜!纽约华人中100万美元,迅速61万现金落袋为安,这张彩票买自唐人街

华人生活网
2026-04-08 05:33:19
上海一公园内,游客爬上樱花树拍照,结果整棵树倒下!网友:不堪重妇!

上海一公园内,游客爬上樱花树拍照,结果整棵树倒下!网友:不堪重妇!

上观新闻
2026-04-07 16:33:38
火箭官宣转正戴维森!敲定季后赛15人名单 杜兰特申京率队冲冠

火箭官宣转正戴维森!敲定季后赛15人名单 杜兰特申京率队冲冠

罗说NBA
2026-04-08 05:24:40
古力娜扎“真空”上阵:是彻底放飞,还是被资本架着走?

古力娜扎“真空”上阵:是彻底放飞,还是被资本架着走?

手工制作阿歼
2026-04-07 17:03:15
人民日报怒批机关事业单位最清闲单位排名,基层人看完太解气了

人民日报怒批机关事业单位最清闲单位排名,基层人看完太解气了

阿莱美食汇
2026-04-07 12:28:06
咸鱼大量流出80元戴尔小主机,拆开看看内部值不值

咸鱼大量流出80元戴尔小主机,拆开看看内部值不值

小兔子发现大事情
2026-04-07 12:40:38
清纯得不像动作片女一号!

清纯得不像动作片女一号!

贵圈真乱
2026-03-26 11:33:33
联合国安理会未能通过霍尔木兹海峡决议草案

联合国安理会未能通过霍尔木兹海峡决议草案

财联社
2026-04-08 00:08:05
2026-04-08 06:43:00
北青网-北京青年报 incentive-icons
北青网-北京青年报
北青网官方网易号
1106815文章数 854313关注度
往期回顾 全部

科技要闻

满嘴谎言!OpenAI奥特曼黑料大起底

头条要闻

特朗普称美方正就伊朗战争进行“激烈谈判”

头条要闻

特朗普称美方正就伊朗战争进行“激烈谈判”

体育要闻

霸气!赵心童:斯诺克的未来定属于中国 20年后50%选手都是中国人

娱乐要闻

女首富陈丽华离世 被曝生前已分好遗产

财经要闻

10万亿财政转移支付,被谁拿走了?

汽车要闻

不止是大 极狐首款MPV问道V9静态体验

态度原创

房产
亲子
手机
数码
公开课

房产要闻

重磅!三亚拟出安居房新政!

亲子要闻

6岁女孩确诊性早熟!医生:小心这些“营养品”和“餐具”

手机要闻

荣耀WIN2系列曝光:10000mAh电池+2nm芯片,续航性能双巅峰!

数码要闻

MacBook Neo爆火背后,苹果芯片库存要见底了?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版