网易首页 > 网易号 > 正文 申请入驻

国产最强语音大模型诞生,MaskGCT宣布开源,声音效果媲美人类

0
分享至

AIxiv专栏是机器之心发布学术、技术内容的栏目。过去数年,机器之心AIxiv专栏接收报道了2000多篇内容,覆盖全球各大高校与企业的顶级实验室,有效促进了学术交流与传播。如果您有优秀的工作想要分享,欢迎投稿或者联系报道。投稿邮箱:liyazhou@jiqizhixin.com;zhaoyunfeng@jiqizhixin.com

近期,港中大(深圳)联手趣丸科技联合推出了新一代大规模声音克隆 TTS 模型 ——MaskGCT。该模型在包含 10 万小时多语言数据的 Emilia 数据集上进行训练,展现出超自然的语音克隆、风格迁移以及跨语言生成能力,同时保持了较强的稳定性。MaskGCT 已在香港中文大学(深圳)与上海人工智能实验室联合开发的开源系统 Amphion 发布。

  • 论文链接:https://arxiv.org/abs/2409.00750
  • 样例展示:https://maskgct.github.io
  • 模型下载:https://huggingface.co/amphion/maskgct
  • Demo 展示:https://huggingface.co/spaces/amphion/maskgct
  • 项目地址:https://github.com/open-mmlab/Amphion/tree/main/models/tts/maskgct
  • 公测应用:voice.funnycp.com

本文介绍了一种名为 Masked Generative Codec Transformer(MaskGCT)的全非自回归 TTS 模型。

现有大规模文本到语音(TTS)系统通常分为自回归和非自回归系统。自回归系统隐式地建模持续时间,但在鲁棒性和持续时间可控性方面存在一定缺陷。非自回归系统在训练过程中需要显式的文本与语音对齐信息,并预测语言单元(如音素)的持续时间,这可能会影响其自然度。

该模型消除了文本与语音监督之间的显式对齐需求,以及音素级持续时间预测。MaskGCT 是一个两阶段模型:在第一阶段,模型使用文本预测从语音自监督学习(SSL)模型中提取的语义标记;在第二阶段,模型基于这些语义标记预测声学标记。MaskGCT 遵循掩码预测学习范式。在训练过程中,MaskGCT 学习根据给定的条件和提示预测掩码的语义或声学标记。在推理过程中,模型以并行方式生成指定长度的标记。通过对 10 万小时的自然语音进行实验,结果表明 MaskGCT 在质量、相似度和可理解性方面优于当前最先进的零样本 TTS 系统。

一、方法

MaskGCT 模型由四个主要组件组成:

1. 语音语义表示编解码器:将语音转换为语义标记。

2. 语音声学编解码器:从声学标记重建波形。

3. 文本到语义模型:使用文本和提示语义标记预测语义标记。

4. 语义到声学模型:基于语义标记预测声学标记。

语音语义表示编解码器用于将语音转换为离散的语义标记,这些标记通常通过离散化来自语音自监督学习(SSL)模型的特征获得。与以往使用 k-means 方法离散化语义特征相比,这种方法可能导致信息损失,从而影响高质量语音的重建或声学标记的精确预测,尤其是在音调丰富的语言中。为了最小化信息损失,本文训练了一个 VQ-VAE 模型来学习一个向量量化码本,该码本能够从语音 SSL 模型中重建语音语义表示。具体来说,使用 W2v-BERT 2.0 模型的第 17 层隐藏状态作为语音编码器的语义特征,编码器和解码器由多个 ConvNext 块组成。通过改进的 VQ-GAN 和 DAC 方法,使用因子分解码将编码器输出投影到低维潜在变量空间。

语音声学编解码器旨在将语音波形量化为多层离散标记,同时尽可能保留语音的所有信息。本文采用残差向量量化(Residual Vector Quantization, RVQ)方法,将 24K 采样率的语音波形压缩为 12 层的离散标记。此外,模型使用 Vocos 架构作为解码器,以提高训练和推理效率。

文本到语义模型采用非自回归掩码生成 Transformer,而不使用自回归模型或任何文本到语音的对齐信息。在训练过程中,我们随机提取语义标记序列的前缀部分作为提示,以利用语言模型的上下文学习能力。我们使用 Llama 风格的 Transformer 作为模型的主干,结合门控线性单元(GLU)和 GELU 激活函数、旋转位置编码等,但将因果注意力替换为双向注意力。还使用了接受时间步 t 作为条件的自适应 RMSNorm。在推理过程中,我们生成任意指定长度的目标语义标记序列,条件是文本和提示语义标记序列。本文还训练了一个基于流匹配的持续时间预测模型,以预测基于文本和提示语音持续时间的总持续时间,利用上下文学习。

语义到声学模型同样采用非自回归掩码生成 Transformer,该模型以语义标记为条件,生成多层声学标记序列以重建高质量语音波形。

二、样例展示

MaskGCT 能超自然地模拟参考音频音色与风格,并跨语言生成音频:

参考音频链接:https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2650940988&idx=5&sn=587fd1152a5c313fc0c65f521a7c9313&chksm=84e7e242b3906b541ca9838161997783f3120a9c186dc3579e79d5ddb6f3fe02bf859317725f&token=820864421&lang=zh_CN#rd

以下是一个展示 MaskGCT 翻译《黑神话:悟空》的实例:

参考音频:

翻译效果:

试听链接:https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2650940988&idx=5&sn=587fd1152a5c313fc0c65f521a7c9313&chksm=84e7e242b3906b541ca9838161997783f3120a9c186dc3579e79d5ddb6f3fe02bf859317725f&token=820864421&lang=zh_CN#rd

四、实验结果

SOTA 的语音合成效果:MaskGCT 在三个 TTS 基准数据集上都达到了 SOTA 效果,在某些指标上甚至超过了人类水平。

此外,MaskGCT 在风格迁移(口音、情感)也达到了 SOTA 的水准:

我们还研究了 MaskGCT 在中、英外其它语言的能力:

五、应用场景

目前,MaskGCT 在短剧出海、智能助手、有声读物、辅助教育等领域拥有丰富的应用场景。为了加快落地应用,在安全合规下,趣丸科技打造了多语种速译智能视听平台 “趣丸千音”。一键上传视频即可快速翻译成多语种版本,并实现音话同步、口型同步、去字幕等功能。该产品进一步革新视频翻译制作流程,大幅降低过往昂贵的人工翻译成本和冗长的制作周期,成为影视、游戏、短剧等内容出海的理想选择平台。

《2024 年短剧出海白皮书》显示,短剧出海成为蓝海新赛道,2023 年海外市场规模高达 650 亿美元,约为国内市场的 12 倍,短剧出海成为蓝海新赛道。以 “趣丸千音” 为代表的产品的出现,将加速国产短剧 “走出去”,进一步推动中华文化在全球不同语境下的传播。

六、总结

MaskGCT 是一个大规模的零样本 TTS 系统,利用全非自回归掩码生成编解码器 Transformer,无需文本与语音的对齐监督和音素级持续时间预测。MaskGCT 通过文本预测从语音自监督学习(SSL)模型中提取的语义标记,然后基于这些语义标记预测声学标记,实现了高质量的文本到语音合成。实验表明,MaskGCT 在语音质量、相似度和可理解性方面优于最先进的 TTS 系统,并且在模型规模和训练数据量增加时表现更佳,同时能够控制生成语音的总时长。此外,我们还探索了 MaskGCT 在语音翻译、语音转换、情感控制和语音内容编辑等任务中的可扩展性,展示了 MaskGCT 作为语音生成基础模型的潜力。

七、团队介绍

  • 王远程:香港中文大学(深圳)计算机科学专业的二年级博士生,研究聚焦语音合成与表征领域,曾作为共同第一作者,研发新一代语音合成系统 NaturalSpeech 3。
  • 武执政:香港中文大学(深圳)副教授、博导,港中大深圳 - 趣丸科技联合实验室主任。入选国家级青年人才,连续多次入选斯坦福大学 “全球前 2%顶尖科学家”、爱思唯尔 “中国高被引学者” 榜单。
  • 曾锐鸿:趣丸科技资深语音算法工程师,研究聚焦跨语言零样本语音合成。曾在顶级期刊 ACM TWEB 发表论文,以及多篇语音识别和语音合成相关发明专利。
  • 詹皓粤:趣丸科技资深语音算法工程师,研究聚焦跨语言零样本语音合成,曾发表多篇领域顶会论文及发明专利。
  • 张强:趣丸科技人工智能研究中心副主任,人工智能高级工程师,专注研究人工智能算法,目前主持语音大模型、2D 和 3D 数字人等技术的研发。
  • 张顺四:趣丸科技副总裁兼人工智能研究中心主任,人工智能高级工程师,粤港澳人工智能产业智库专家,长期从事低延迟音视频通讯技术和人工智能技术的研究,主导过千万级日活产品。发表技术发明专利 30 余篇,发表 EI 3 篇,SCI 3 篇。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
12吨巧克力离奇被盗,41万根巧克力与货车至今下落不明,失窃巧克力系F1特别款,外形为赛车形状

12吨巧克力离奇被盗,41万根巧克力与货车至今下落不明,失窃巧克力系F1特别款,外形为赛车形状

极目新闻
2026-03-30 10:23:56
真的来了!5099 的 iPhone Air 正式上架

真的来了!5099 的 iPhone Air 正式上架

XCiOS俱乐部
2026-03-30 08:58:50
副部级高官任上落马,任职地多名前下属被查

副部级高官任上落马,任职地多名前下属被查

中国新闻周刊
2026-03-29 09:44:48
三大指数均跌逾1%,下跌个股近4600只

三大指数均跌逾1%,下跌个股近4600只

界面新闻
2026-03-30 09:56:54
不结婚怎么解决生理需求?62岁的陈瑾,用实际行动给出了正确答案

不结婚怎么解决生理需求?62岁的陈瑾,用实际行动给出了正确答案

鲸探所长
2026-03-30 14:33:32
在医院你遭遇过最羞耻的事是什么?网友:一个比一个炸裂啊

在医院你遭遇过最羞耻的事是什么?网友:一个比一个炸裂啊

解读热点事件
2026-02-04 00:05:07
笑死我了!一位三年级小朋友趁妈妈洗澡的缝隙时间,和豆包的对话

笑死我了!一位三年级小朋友趁妈妈洗澡的缝隙时间,和豆包的对话

夜深爱杂谈
2026-03-21 19:50:42
朝鲜国防科学院院长脱军装了?

朝鲜国防科学院院长脱军装了?

IN朝鲜
2026-03-30 15:06:40
南非奥运冠军斥性别检测“是对女性不尊重”,特朗普发文祝贺新规

南非奥运冠军斥性别检测“是对女性不尊重”,特朗普发文祝贺新规

我是盲流
2026-03-30 07:35:11
悲哀!42岁男子一直没找到工作,被父亲怒斥好吃懒做,哭诉怎么办

悲哀!42岁男子一直没找到工作,被父亲怒斥好吃懒做,哭诉怎么办

火山詩话
2026-03-30 07:02:48
快船5连胜双杀雄鹿!小卡连续51场20+分 大洛获致敬迎盖帽里程碑

快船5连胜双杀雄鹿!小卡连续51场20+分 大洛获致敬迎盖帽里程碑

罗说NBA
2026-03-30 06:00:26
44名美军死亡只是开始!

44名美军死亡只是开始!

安安说
2026-03-29 12:50:51
人口告别世界第一?二孩催生无效后,国家终于向住房出手了

人口告别世界第一?二孩催生无效后,国家终于向住房出手了

猪小艳吖
2026-03-16 19:59:46
李荣浩怒斥单依纯不到24小时,薛之谦罕见发声,赢得全网好感

李荣浩怒斥单依纯不到24小时,薛之谦罕见发声,赢得全网好感

往史过眼云烟
2026-03-30 14:36:04
本月开始中国或将迎来4大涨价潮:除油价以外,这4类也要涨价了

本月开始中国或将迎来4大涨价潮:除油价以外,这4类也要涨价了

混沌录
2026-03-28 15:49:05
被张雪峰怼惨而掐掉的应该是局座张召忠,这是他的短腿

被张雪峰怼惨而掐掉的应该是局座张召忠,这是他的短腿

雪中风车
2026-03-30 09:51:26
世界上五个最不务正业的科学家!看完三观都碎了…

世界上五个最不务正业的科学家!看完三观都碎了…

新浪财经
2026-03-12 09:55:40
沙溢当众殴打李晨,被告上仲裁会:永远不要轻易评价一个人

沙溢当众殴打李晨,被告上仲裁会:永远不要轻易评价一个人

圆梦的小老头
2026-03-15 03:37:22
蒯曼3-2卢茨采访!回应三四局连丢与后续调整,展望下场王艾米!

蒯曼3-2卢茨采访!回应三四局连丢与后续调整,展望下场王艾米!

篮球资讯达人
2026-03-30 12:35:44
2007年,孔令仪在上海宋庆龄陵园扫墓时的留影,第二年她就去世了

2007年,孔令仪在上海宋庆龄陵园扫墓时的留影,第二年她就去世了

芳芳历史烩
2026-03-30 12:05:05
2026-03-30 15:36:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
12639文章数 142599关注度
往期回顾 全部

科技要闻

DeepSeek性能异常问题已解决,服务恢复

头条要闻

美国如果发动地面战 本次战事军费或突破10万亿美元

头条要闻

美国如果发动地面战 本次战事军费或突破10万亿美元

体育要闻

想进世界杯,意大利还要过他这一关

娱乐要闻

单依纯凌晨发长文道歉!李荣浩再回应

财经要闻

油价冲击,有些亚洲货币先扛不住了!

汽车要闻

理想i9要来了!外形似小号MEGA 能冲击高端纯电市场?

态度原创

时尚
教育
手机
旅游
本地

来到1980的周也,好毛利兰

教育要闻

关注!西城市重点中学招聘教师啦

手机要闻

古尔曼:若苹果在自家地图应用中引入广告,或将“激怒用户”

旅游要闻

喜迎贵州旅发大会·水墨贵阳④:多彩贵州城

本地新闻

用Color Walk的方式解锁城市春日

无障碍浏览 进入关怀版