网易首页 > 网易号 > 正文 申请入驻

会说24种语言、能「捏」出任意音色、还能随手改:小红书FireRedTTS3发布!

0
分享至

来源:市场资讯

(来源:机器之心)

小红书 FireRed 团队发布新一代语音生成与编辑模型 FireRedTTS3。它用同一个模型打通了语音的三大能力——多语言、多方言的零样本音色克隆,用自然语言「描述」就能定制的声音设计,以及「哪里不满意改哪里」的精准语音编辑,并在四大公开评测集上全面达到行业领先水平。

  • 论文标题:FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations

  • 技术报告:https://arxiv.org/abs/2608.17492

  • Demo 链接:https://fireredteam.github.io/demos/firered_tts_3/

  • 代码链接:https://github.com/FireRedTeam/FireRedTTS3

给它几秒钟你的声音,它就能用「你」说 24 种语言、21 种中文方言;给它一句话描述,它能凭空「捏」出一个从不存在的声音;给它一段现成的语音,它能像改文档一样,只动你圈出来的那一处,其余分毫不改、音色不飘。克隆、设计、编辑——过去得靠三套系统才能干的事,现在一个模型全包了。

秘密藏在一个叫 RedAE 的语音表示里:它请了一位「语义老师」,在源头就把语义「教」进声音的表示中。于是不堆模块、不搞多阶段训练、不叠复杂架构,就稳稳压住了连续语音生成最头疼的老毛病——「越说越跑偏」。

成绩也够硬:音色克隆的准确率和相似度双料第一(Seed-TTS-Eval 3.04% / 78.8%),24 种语言的克隆同样双料第一(3.75% / 84.8%),声音设计和语音编辑两个榜单也一并领先。

先上耳朵:这几段声音,你能分清真假吗?

继 FireRedTTS-2 把长对话与播客生成做到工业级之后,FireRedTTS3 这次把能力从「把一句话说好」,一路推到了「克隆、设计、编辑一手包办」。道理讲一万句,不如亲耳听一段。先来听四段——留个心眼:哪句是 AI,哪句又被悄悄「动过刀」?

先听听世界各地的朋友怎么聊世界杯。趁着世界杯的余热,不同语言、不同口音轮番上阵;但你可能想不到,这些声音其实出自同一套模型之口。

接下来,我们来听下各地区的网友们用亲切的方言向大师提问。你觉得他们的口音正宗不正宗呢?

如果说「说好各类语言」拼的是广度,那下面这个,拼的是「无中生有」。这一次,我们不给模型提供参考音频,只甩过去一句「需求描述」——想要什么样的声儿,说一句话就行。

能凭空造声,那能不能在一段已经录好的声音上「做手术」?最后这个有点像变魔术:一段现成的话,我们只想改其中一个词,或调一点语速,其他地方一个字都不许动。来看看它是不是做到了「指哪改哪、改完还听不出痕迹」。

四段听下来,克隆、设计、编辑,它一个没落。那么问题来了:一个模型,凭什么能同时把这三件事都干好?

要讲清这一点,得先回到一个更根本的问题——我们为什么需要这样一个模型。

过去两年,TTS 在零样本音色克隆上已经相当成熟。但用户的诉求正在快速升级——不再满足于「复刻一个声音」,而是希望:

  • 能用自然语言描述来设计声音(我说「我要一个什么样的声音」,模型就给我什么样的声音);

  • 能对已有语音做精准的局部修改(只改我指定的字 / 语速等,别的地方不要动)。

一句话概括,需求正在从「克隆」走向「控制」。而「控制」二字,恰恰是最难啃的骨头。

想让机器「听话」,到底卡在哪?

要做到「控制」,模型必须闯过三关:听懂自然语言指令 → 把指令精确落到某个语音属性或某个片段上 → 且不破坏未指定的部分。而这一切的地基,是语音表示必须同时编码好两类信息:语义(内容 / 风格 / 意图)与声学细节(音色 / 气声 / 音高的细微起伏)。

偏偏现有三条技术路线,在「语义 + 声学 + 可控」上都各有短板:

  • 非自回归 Flow Matching:架构决定了难以借力文本大模型的指令跟随能力;

  • 离散 Token(VQ / RVQ):量化会抹掉细粒度声学细节,在语音编辑这类声学敏感任务上易失真;

  • 连续自回归(LLM-DiT):连续空间无界,微小误差在自回归中不断累积,导致音色漂移、韵律崩溃。

连续自回归目前是最有希望的一条路,但「误差累积」是它绕不开的坎。此前学界主要从两个方向补救:一是给连续表示补语义(如 Ming-UniAudio 额外加模块抽语义、VibeVoice 用单独的语义 VAE、dots.tts 在 VAE 训练里加 ASR 目标);二是在自回归阶段正则化特征空间(如 VoxCPM 引入 FSQ 瓶颈)。但方向一往往要额外挂语义模块,或搞多阶段 tokenizer 训练;方向二则会让架构变复杂。

于是 FireRedTTS3 换了个思路发问:能不能在「表示」这一层就把误差累积缓解掉,且系统依然简单?我们的答案,就从最底层的「表示」动起。

破局第一步:让「表示」自己就带语义——RedAE

FireRedTTS3 的第一块基石,是连续语音 tokenizer RedAE。它的核心思路可以一句话概括:不额外加语义模块、不搞多阶段训练,而是请一位「语义老师」,在 tokenizer 训练时就把语义「教」进连续表示里。


图 1|RedAE 结构示意图

语义老师从哪来。团队先训练了一个音频理解模型 FireRedAudio,让它在 ASR、说话人验证等多种语音理解任务上学习——这样它的 Audio Encoder 天然同时懂「内容语义」和「说话人声学线索」。

老师怎么教。训练 RedAE 时,把这个 Audio Encoder 冻结当作语义教师,让 RedAE 输出的连续表示去对齐老师的特征(最小化两者的 MSE,即语义蒸馏损失)。训练完成后,这位老师功成身退——下游生成阶段完全不再需要它,因此不增加任何推理成本。

为什么保真度不打折。RedAE 刻意省去了常见的 KL 正则,避免声学信息被过度压缩,从而把音色里那些「容易被量化抹掉」的细节完整留下——这正是它在音色相似度上领先的关键。

架构与训练细节。输入 24 kHz 波形被切成不重叠的 480 采样点帧(得到 50 Hz 序列),经两个级联的 Qwen3 风格 Transformer 处理:第一个在 50 Hz 做上下文建模,第二个通过基于注意力的池化下采样到 25 Hz(每两帧合成一个 patch)。

整体在 GAN 框架下训练,生成器损失包含对抗、多尺度 Mel 重建、特征匹配、语义蒸馏四项。RedAE 的 Encoder 与 Decoder 在单一阶段联合训练,没有额外语义分支、没有多阶段流水线;训练用了 50 万小时多样音频(干净语音 50% / 带噪 25% / 音效 10% / 音乐 15%),在 32 张 H800 上跑 55 万步。

破局第二步:一套轻框架,一口气干三件事

有了会「自带语义」的好表示,下一步就是造一个会用它的生成框架。在 RedAE 之上,FireRedTTS3 用一个轻量的 LLM-DiT 框架做生成,由三个组件组成:


  • Aggregator:把 25 Hz 的 RedAE 表示进一步压成 6.25 Hz 的 latent patch,缩短序列、降低建模难度;

  • Backbone Transformer:从 Qwen3 文本大模型初始化,以继承文本理解与指令跟随能力,负责自回归地建模「文本 token + latent patch」;

  • DiT 模块:一个全注意力 Transformer,在 Backbone 的条件下做 patch 级去噪——每一步的输入是「一个带噪的当前 patch(4 帧)+ 12 帧干净的历史 latent」,历史 latent 始终保留,以维持时间连贯性;训练时以 0.1 概率随机丢弃条件做 CFG。

同样一套框架,团队按「专精」与「全能」分出两个版本:

FireRedTTS3-Base(面向多语言、多方言克隆)

  • Backbone 从 Qwen3-1.7B-Base 初始化;用 CAM++ 提取说话人嵌入,既拼进 Backbone 输入,又作为 DiT 的说话人条件,以强化音色一致性;文本前加语言标签指示目标语种。

  • 两阶段训练:第一阶段用 260 万小时中英文语音(17 万步)打好零样本克隆底子;第二阶段在 56 万小时、覆盖 24 种语言 + 21 种中文方言的数据上继续训练,扩展到多语言、多方言。

FireRedTTS3-Instruct(统一克隆 / 设计 / 编辑)

  • Backbone 从带指令能力的 Qwen3-1.7B 初始化,采用 ChatML 格式,用不同的 system prompt 区分任务。

  • 关键设计是「先规划、再合成」:模型先把用户指令翻译成一份结构化文本方案——声音设计时,把自由描述拆解成 12 个具体声学属性的序列;语音编辑时,把指令展开成目标转录 + 编辑区域掩码,从而只改指定区域、保留其余部分。

  • 保留 Qwen3 的文本头以支持这个中间规划过程;与 Base 不同,Instruct 不使用显式说话人嵌入和语言标签。第二阶段在 33 万小时声音设计与语音编辑数据上训练 4 万步。

是骡子是马,拉到四个榜单上遛一遛

方法讲得再漂亮,也得拿成绩说话。我们把 FireRedTTS3 拉到四个公开评测集上,和业界最强的一批模型正面掰手腕。

在评估中英文零样本音色克隆的 Seed-TTS-Eval 上,FireRedTTS3-Base 取得了最低的平均错误率与最高的平均说话人相似度——Test-EN 与 Test-ZH 的相似度均为最优。这印证了「语义化的连续表示」能为 LLM-DiT 提供稳定的建模目标,带来更鲁棒的文本—语音对齐;而由于避免了量化带来的声学信息损失,它在音色相似度上的优势尤为明显。


一个模型说好中英文不难,难的是「通吃」几十种语言。当把范围扩展到 24 种语言的 MiniMax-MLS-Test 时,FireRedTTS3-Base 依然拿到了全部语言中最低的平均错误率(3.75%)与最高的平均相似度(84.8%),并在 22 / 24 种语言的相似度上位列第一或第二。

尤其值得一提的是,葡萄牙语与乌克兰语并不在 RedAE 的训练数据里,模型仍给出了有竞争力的结果,体现出 RedAE 表示对未见语言的泛化能力。


克隆能力见了真章,接下来看「听指令办事」的本事。在考察声音设计能力的 InstructTTSEval 上(评测集共 6000 条样本,中英文子集各 3000 条),FireRedTTS3-Instruct 于中、英文的三类指令——声学参数指定(APS)、风格描述(DSD)、角色扮演(RP)——上均取得最佳成绩。

这得益于它「先把指令解析成 12 维结构化文本方案、再合成」的设计,有效降低了自然语言指令的歧义,实现了对指令的解耦。

具体而言:对于 APS 任务,它从复杂的声学参数化指令中提取显式属性;对于 DSD 和 RP 任务,它将抽象的风格描述或角色画像转化为具体的声学方案,从而提高对用户指令的遵循度。

除了对指令解耦,FireRedTTS3-Instruct 还学习到了从这些规划好的声学属性序列到 RedAE 语音表示之间的稳定映射,从而能够有效控制目标音色合成。


最考验功力的,是「动刀」而不留痕。最后,在评估语音编辑的 Ming-Freeform-Audio-Edit 榜单上,无论是声学编辑(语速、音高、音量),还是语义编辑(插入、删除、替换),FireRedTTS3-Instruct 大多都处于领先地位,且在自由指令的 open 设定下表现同样稳定。

从核心评测指标来看:更低的 WER(字错率)与 NoEdit WER(未编辑区字错率),配合极高的 ACC(编辑准确率),共同确保了内容修改准确无误;大幅领先的 SIM(说话人相似度)保证了音色稳定不漂移;而极低的 RDE / RAE(声学误差率)则证明了它能精准修改到目标的音量与时长。模型真正实现了我们期望的「改得准、其余不变、音色不漂」。



写在最后:让声音,像文字一样自由

四个榜单的第一背后,其实是一个朴素的判断。FireRedTTS3 的关键,是把「抑制误差累积」这件事下沉到了表示层:用一位冻结的语义教师,把语义在 tokenizer 阶段就注入连续表示(RedAE),让稳定性成为表示与生俱来的属性。

由此,音色克隆、声音设计、语音编辑第一次被统一进同一套简单的 LLM-DiT 框架——tokenizer 单阶段训练、无额外语义模块、无复杂结构,却在四个公开评测集上同时领先。简单,在这里不是妥协,而是让它有资格成为可持续生长的「基座」。

而从 FireRedTTS、FireRedTTS-1S、FireRedTTS-2 到今天的 FireRedTTS3,小红书 FireRed 团队始终在做同一件事:构建一套可生长的语音生成基础设施。

当「生成」与「修改」都能用一句话完成,声音创作的门槛将被大幅拉平——让不懂声学参数的普通人,也能像编辑文字一样编辑语音。未来,团队将继续拓展语种与方言、丰富指令控制与编辑的边界,让声音真正成为一种人人可写、可改、可创作的表达介质。

这条以「表示」为起点的路,才刚刚展开。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
戴夫·巴蒂斯塔确认在《战神》真人剧中饰演奎托斯

戴夫·巴蒂斯塔确认在《战神》真人剧中饰演奎托斯

玩家派对GamerParty
2026-08-21 14:39:09
张文宏谈“长寿真相”,分享自己的一日三餐和护牙心得,提醒打包菜别直接吃

张文宏谈“长寿真相”,分享自己的一日三餐和护牙心得,提醒打包菜别直接吃

人间颂
2026-08-21 11:50:09
“活久见,飞机座位上拉屎被我遇到”“大家想逃,闻着弥漫的臭味”,航司回应

“活久见,飞机座位上拉屎被我遇到”“大家想逃,闻着弥漫的臭味”,航司回应

南方都市报
2026-08-21 14:34:20
千亿上市敲钟现场,宇树科技王兴兴表情平静,圈内投资人:他在密集镜头前习惯性收敛笑容,但私下场合会笑

千亿上市敲钟现场,宇树科技王兴兴表情平静,圈内投资人:他在密集镜头前习惯性收敛笑容,但私下场合会笑

极目新闻
2026-08-20 22:55:59
财政部:始终坚持扩大内需这一战略基点 推出一系列政策来促进居民消费提质升级

财政部:始终坚持扩大内需这一战略基点 推出一系列政策来促进居民消费提质升级

北青网-北京青年报
2026-08-21 12:08:10
入秋后,吃“秋季第一鲜”,包饺子蒸包子都特香,胜过白菜、韭菜

入秋后,吃“秋季第一鲜”,包饺子蒸包子都特香,胜过白菜、韭菜

阿龙美食记
2026-08-19 15:53:24
终于知道为啥中国人没有蓄须的习惯了!评论区剖析一针见血,太精辟

终于知道为啥中国人没有蓄须的习惯了!评论区剖析一针见血,太精辟

夜深爱杂谈
2026-08-15 21:16:22
美国财长喊话中国,必须配合美方收拾伊朗,否则就是跟美国为敌

美国财长喊话中国,必须配合美方收拾伊朗,否则就是跟美国为敌

史料布籍
2026-08-21 13:45:02
攒11年买下32平房!百花影后卫诗雅好心酸,谢霆锋到她家坐床吃饭

攒11年买下32平房!百花影后卫诗雅好心酸,谢霆锋到她家坐床吃饭

可乐谈情感
2026-08-20 11:19:10
通报只写“推倒致伤”可杭州包厢案受害者查出了9处外伤、轻伤二级

通报只写“推倒致伤”可杭州包厢案受害者查出了9处外伤、轻伤二级

智慧生活笔记
2026-08-21 02:08:30
亚运会临近,张本美和放豪言:我要成为日本时隔60年的“四冠王”

亚运会临近,张本美和放豪言:我要成为日本时隔60年的“四冠王”

十点街球体育
2026-08-20 20:09:14
5死17伤!四川升学宴追踪:命大的人出现了,她坐在墙体坍塌范围内,旁边的人突然全躺下了

5死17伤!四川升学宴追踪:命大的人出现了,她坐在墙体坍塌范围内,旁边的人突然全躺下了

火山詩话
2026-08-20 05:21:09
67岁许家印当庭认罪,背后3座“靠山”也全倒了:一死一病一死缓

67岁许家印当庭认罪,背后3座“靠山”也全倒了:一死一病一死缓

标体
2026-08-15 10:49:37
郑爽美国近况被曝!扒完她的财务和官司才发现,不是不想国,而是回不来了

郑爽美国近况被曝!扒完她的财务和官司才发现,不是不想国,而是回不来了

澳洲红领巾
2026-08-19 15:25:13
测量319位中国女性外阴,他们发表全球首例研究

测量319位中国女性外阴,他们发表全球首例研究

医学界妇产科频道
2026-06-27 19:51:42
6297元起!新机官宣:8月27日,正式发布!

6297元起!新机官宣:8月27日,正式发布!

科技堡垒
2026-08-21 11:52:06
13.18万!丰田新车正式上市

13.18万!丰田新车正式上市

科技堡垒
2026-08-20 11:41:26
瓜帅离队后曼城曝内讧:瓜帅决赛质问哈兰德,怒喷不防守不跑位

瓜帅离队后曼城曝内讧:瓜帅决赛质问哈兰德,怒喷不防守不跑位

小金体坛大视野
2026-08-21 13:15:03
古代嫔妃侍寝有三条铁律:一不准出声,另两条脏的连史官都不敢写

古代嫔妃侍寝有三条铁律:一不准出声,另两条脏的连史官都不敢写

千秋文化
2026-08-20 20:39:41
爱上已婚胡军、为富豪生双胞胎?刘涛近况曝光,资源下跌,8年睡不着

爱上已婚胡军、为富豪生双胞胎?刘涛近况曝光,资源下跌,8年睡不着

领略非凡
2026-08-21 09:46:14
2026-08-21 15:16:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4502925文章数 9328关注度
往期回顾 全部

科技要闻

阿里AI的两面:云赚56亿,千问烧掉138亿

头条要闻

特朗普称今年要见金正恩 罕见指出朝鲜有57枚核武器

头条要闻

特朗普称今年要见金正恩 罕见指出朝鲜有57枚核武器

体育要闻

46岁小罗抵达意大利 将为拉文纳征战意丙

娱乐要闻

迪丽热巴与陈飞宇的恋情罗生门

财经要闻

三部门发布多条促内需优化政策

汽车要闻

全新长轴距GLE SUV全球首秀 奔驰全品牌矩阵集结蓉城

态度原创

健康
亲子
时尚
家居
公开课

脊柱侧弯到什么程度,需要戴支具?

亲子要闻

一个很危险的现象:越来越多的孩子已经“脑腐”了,暑假正是高发期

白西装,很大气!

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版