网易首页 > 网易号 > 正文 申请入驻

会说24种语言、能「捏」出任意音色、还能随手改:小红书FireRedTTS3发布!

0
分享至



小红书 FireRed 团队发布新一代语音生成与编辑模型 FireRedTTS3。它用同一个模型打通了语音的三大能力——多语言、多方言的零样本音色克隆,用自然语言「描述」就能定制的声音设计,以及「哪里不满意改哪里」的精准语音编辑,并在四大公开评测集上全面达到行业领先水平。

  • 论文标题:FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations
  • 技术报告:https://arxiv.org/abs/2608.17492
  • Demo 链接:https://fireredteam.github.io/demos/firered_tts_3/
  • 代码链接:https://github.com/FireRedTeam/FireRedTTS3

给它几秒钟你的声音,它就能用「你」说 24 种语言、21 种中文方言;给它一句话描述,它能凭空「捏」出一个从不存在的声音;给它一段现成的语音,它能像改文档一样,只动你圈出来的那一处,其余分毫不改、音色不飘。克隆、设计、编辑——过去得靠三套系统才能干的事,现在一个模型全包了。

秘密藏在一个叫 RedAE 的语音表示里:它请了一位「语义老师」,在源头就把语义「教」进声音的表示中。于是不堆模块、不搞多阶段训练、不叠复杂架构,就稳稳压住了连续语音生成最头疼的老毛病——「越说越跑偏」。

成绩也够硬:音色克隆的准确率和相似度双料第一(Seed-TTS-Eval 3.04% / 78.8%),24 种语言的克隆同样双料第一(3.75% / 84.8%),声音设计和语音编辑两个榜单也一并领先。

先上耳朵:这几段声音,你能分清真假吗?

继 FireRedTTS-2 把长对话与播客生成做到工业级之后,FireRedTTS3 这次把能力从「把一句话说好」,一路推到了「克隆、设计、编辑一手包办」。道理讲一万句,不如亲耳听一段。先来听四段——留个心眼:哪句是 AI,哪句又被悄悄「动过刀」?

先听听世界各地的朋友怎么聊世界杯。趁着世界杯的余热,不同语言、不同口音轮番上阵;但你可能想不到,这些声音其实出自同一套模型之口。



视频链接:https://mp.weixin.qq.com/s/0Wuzqs8CtZg9_tYDHfSr8g

接下来,我们来听下各地区的网友们用亲切的方言向大师提问。你觉得他们的口音正宗不正宗呢?



视频链接:https://mp.weixin.qq.com/s/0Wuzqs8CtZg9_tYDHfSr8g

如果说「说好各类语言」拼的是广度,那下面这个,拼的是「无中生有」。这一次,我们不给模型提供参考音频,只甩过去一句「需求描述」——想要什么样的声儿,说一句话就行。



视频链接:https://mp.weixin.qq.com/s/0Wuzqs8CtZg9_tYDHfSr8g

能凭空造声,那能不能在一段已经录好的声音上「做手术」?最后这个有点像变魔术:一段现成的话,我们只想改其中一个词,或调一点语速,其他地方一个字都不许动。来看看它是不是做到了「指哪改哪、改完还听不出痕迹」。



视频链接:https://mp.weixin.qq.com/s/0Wuzqs8CtZg9_tYDHfSr8g

四段听下来,克隆、设计、编辑,它一个没落。那么问题来了:一个模型,凭什么能同时把这三件事都干好?

要讲清这一点,得先回到一个更根本的问题——我们为什么需要这样一个模型。

过去两年,TTS 在零样本音色克隆上已经相当成熟。但用户的诉求正在快速升级——不再满足于「复刻一个声音」,而是希望:

  • 能用自然语言描述来设计声音(我说「我要一个什么样的声音」,模型就给我什么样的声音);
  • 能对已有语音做精准的局部修改(只改我指定的字 / 语速等,别的地方不要动)。

一句话概括,需求正在从「克隆」走向「控制」。而「控制」二字,恰恰是最难啃的骨头。

想让机器「听话」,到底卡在哪?

要做到「控制」,模型必须闯过三关:听懂自然语言指令 → 把指令精确落到某个语音属性或某个片段上 → 且不破坏未指定的部分。而这一切的地基,是语音表示必须同时编码好两类信息:语义(内容 / 风格 / 意图)与声学细节(音色 / 气声 / 音高的细微起伏)。

偏偏现有三条技术路线,在「语义 + 声学 + 可控」上都各有短板:

  • 非自回归 Flow Matching:架构决定了难以借力文本大模型的指令跟随能力;
  • 离散 Token(VQ / RVQ):量化会抹掉细粒度声学细节,在语音编辑这类声学敏感任务上易失真;
  • 连续自回归(LLM-DiT):连续空间无界,微小误差在自回归中不断累积,导致音色漂移、韵律崩溃。

连续自回归目前是最有希望的一条路,但「误差累积」是它绕不开的坎。此前学界主要从两个方向补救:一是给连续表示补语义(如 Ming-UniAudio 额外加模块抽语义、VibeVoice 用单独的语义 VAE、dots.tts 在 VAE 训练里加 ASR 目标);二是在自回归阶段正则化特征空间(如 VoxCPM 引入 FSQ 瓶颈)。但方向一往往要额外挂语义模块,或搞多阶段 tokenizer 训练;方向二则会让架构变复杂。

于是 FireRedTTS3 换了个思路发问:能不能在「表示」这一层就把误差累积缓解掉,且系统依然简单?我们的答案,就从最底层的「表示」动起。

破局第一步:让「表示」自己就带语义——RedAE

FireRedTTS3 的第一块基石,是连续语音 tokenizer RedAE。它的核心思路可以一句话概括:不额外加语义模块、不搞多阶段训练,而是请一位「语义老师」,在 tokenizer 训练时就把语义「教」进连续表示里。



图 1|RedAE 结构示意图

语义老师从哪来。团队先训练了一个音频理解模型 FireRedAudio,让它在 ASR、说话人验证等多种语音理解任务上学习——这样它的 Audio Encoder 天然同时懂「内容语义」和「说话人声学线索」。

老师怎么教。训练 RedAE 时,把这个 Audio Encoder 冻结当作语义教师,让 RedAE 输出的连续表示去对齐老师的特征(最小化两者的 MSE,即语义蒸馏损失)。训练完成后,这位老师功成身退——下游生成阶段完全不再需要它,因此不增加任何推理成本。

为什么保真度不打折。RedAE 刻意省去了常见的 KL 正则,避免声学信息被过度压缩,从而把音色里那些「容易被量化抹掉」的细节完整留下——这正是它在音色相似度上领先的关键。

架构与训练细节。输入 24 kHz 波形被切成不重叠的 480 采样点帧(得到 50 Hz 序列),经两个级联的 Qwen3 风格 Transformer 处理:第一个在 50 Hz 做上下文建模,第二个通过基于注意力的池化下采样到 25 Hz(每两帧合成一个 patch)。

整体在 GAN 框架下训练,生成器损失包含对抗、多尺度 Mel 重建、特征匹配、语义蒸馏四项。RedAE 的 Encoder 与 Decoder 在单一阶段联合训练,没有额外语义分支、没有多阶段流水线;训练用了 50 万小时多样音频(干净语音 50% / 带噪 25% / 音效 10% / 音乐 15%),在 32 张 H800 上跑 55 万步。

破局第二步:一套轻框架,一口气干三件事

有了会「自带语义」的好表示,下一步就是造一个会用它的生成框架。在 RedAE 之上,FireRedTTS3 用一个轻量的 LLM-DiT 框架做生成,由三个组件组成:



图 2|LLM-DiT 结构,左为 FireRed-Base,右为 FireRed-Instruct

  • Aggregator:把 25 Hz 的 RedAE 表示进一步压成 6.25 Hz 的 latent patch,缩短序列、降低建模难度;
  • Backbone Transformer:从 Qwen3 文本大模型初始化,以继承文本理解与指令跟随能力,负责自回归地建模「文本 token + latent patch」;
  • DiT 模块:一个全注意力 Transformer,在 Backbone 的条件下做 patch 级去噪——每一步的输入是「一个带噪的当前 patch(4 帧)+ 12 帧干净的历史 latent」,历史 latent 始终保留,以维持时间连贯性;训练时以 0.1 概率随机丢弃条件做 CFG。

同样一套框架,团队按「专精」与「全能」分出两个版本:

FireRedTTS3-Base(面向多语言、多方言克隆)

  • Backbone 从 Qwen3-1.7B-Base 初始化;用 CAM++ 提取说话人嵌入,既拼进 Backbone 输入,又作为 DiT 的说话人条件,以强化音色一致性;文本前加语言标签指示目标语种。
  • 两阶段训练:第一阶段用 260 万小时中英文语音(17 万步)打好零样本克隆底子;第二阶段在 56 万小时、覆盖 24 种语言 + 21 种中文方言的数据上继续训练,扩展到多语言、多方言。

FireRedTTS3-Instruct(统一克隆 / 设计 / 编辑)

  • Backbone 从带指令能力的 Qwen3-1.7B 初始化,采用 ChatML 格式,用不同的 system prompt 区分任务。
  • 关键设计是「先规划、再合成」:模型先把用户指令翻译成一份结构化文本方案——声音设计时,把自由描述拆解成 12 个具体声学属性的序列;语音编辑时,把指令展开成目标转录 + 编辑区域掩码,从而只改指定区域、保留其余部分。
  • 保留 Qwen3 的文本头以支持这个中间规划过程;与 Base 不同,Instruct 不使用显式说话人嵌入和语言标签。第二阶段在 33 万小时声音设计与语音编辑数据上训练 4 万步。

是骡子是马,拉到四个榜单上遛一遛

方法讲得再漂亮,也得拿成绩说话。我们把 FireRedTTS3 拉到四个公开评测集上,和业界最强的一批模型正面掰手腕。

在评估中英文零样本音色克隆的 Seed-TTS-Eval 上,FireRedTTS3-Base 取得了最低的平均错误率与最高的平均说话人相似度——Test-EN 与 Test-ZH 的相似度均为最优。这印证了「语义化的连续表示」能为 LLM-DiT 提供稳定的建模目标,带来更鲁棒的文本—语音对齐;而由于避免了量化带来的声学信息损失,它在音色相似度上的优势尤为明显。



图 3|Seed-TTS-Eval 零样本克隆结果。所有结果均统一使用官方开源脚本测得

一个模型说好中英文不难,难的是「通吃」几十种语言。当把范围扩展到 24 种语言的 MiniMax-MLS-Test 时,FireRedTTS3-Base 依然拿到了全部语言中最低的平均错误率(3.75%)与最高的平均相似度(84.8%),并在 22 / 24 种语言的相似度上位列第一或第二。

尤其值得一提的是,葡萄牙语与乌克兰语并不在RedAE 的训练数据里,模型仍给出了有竞争力的结果,体现出 RedAE 表示对未见语言的泛化能力。



图 4|MiniMax-MLS-Test 多语种测评结果

克隆能力见了真章,接下来看「听指令办事」的本事。在考察声音设计能力的 InstructTTSEval 上(评测集共 6000 条样本,中英文子集各 3000 条),FireRedTTS3-Instruct 于中、英文的三类指令——声学参数指定(APS)、风格描述(DSD)、角色扮演(RP)——上均取得最佳成绩。

这得益于它「先把指令解析成 12 维结构化文本方案、再合成」的设计,有效降低了自然语言指令的歧义,实现了对指令的解耦。

具体而言:对于 APS 任务,它从复杂的声学参数化指令中提取显式属性;对于 DSD 和 RP 任务,它将抽象的风格描述或角色画像转化为具体的声学方案,从而提高对用户指令的遵循度。

除了对指令解耦,FireRedTTS3-Instruct 还学习到了从这些规划好的声学属性序列到 RedAE 语音表示之间的稳定映射,从而能够有效控制目标音色合成。



图 5|InstructTTSEval 指令控制声音设计结果

最考验功力的,是「动刀」而不留痕。最后,在评估语音编辑的 Ming-Freeform-Audio-Edit 榜单上,无论是声学编辑(语速、音高、音量),还是语义编辑(插入、删除、替换),FireRedTTS3-Instruct 大多都处于领先地位,且在自由指令的 open 设定下表现同样稳定。

从核心评测指标来看:更低的 WER(字错率)与 NoEdit WER(未编辑区字错率),配合极高的 ACC(编辑准确率),共同确保了内容修改准确无误;大幅领先的 SIM(说话人相似度)保证了音色稳定不漂移;而极低的 RDE / RAE(声学误差率)则证明了它能精准修改到目标的音量与时长。模型真正实现了我们期望的「改得准、其余不变、音色不漂」。



图 6|Ming-Freeform-Audio-Edit 声学编辑结果



图 7|Ming-Freeform-Audio-Edit 语义编辑结果

写在最后:让声音,像文字一样自由

四个榜单的第一背后,其实是一个朴素的判断。FireRedTTS3 的关键,是把「抑制误差累积」这件事下沉到了表示层:用一位冻结的语义教师,把语义在 tokenizer 阶段就注入连续表示(RedAE),让稳定性成为表示与生俱来的属性。

由此,音色克隆、声音设计、语音编辑第一次被统一进同一套简单的 LLM-DiT 框架——tokenizer 单阶段训练、无额外语义模块、无复杂结构,却在四个公开评测集上同时领先。简单,在这里不是妥协,而是让它有资格成为可持续生长的「基座」。

而从 FireRedTTS、FireRedTTS-1S、FireRedTTS-2 到今天的 FireRedTTS3,小红书 FireRed 团队始终在做同一件事:构建一套可生长的语音生成基础设施。

当「生成」与「修改」都能用一句话完成,声音创作的门槛将被大幅拉平——让不懂声学参数的普通人,也能像编辑文字一样编辑语音。未来,团队将继续拓展语种与方言、丰富指令控制与编辑的边界,让声音真正成为一种人人可写、可改、可创作的表达介质。

这条以「表示」为起点的路,才刚刚展开。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
真鸡贼!安踏CEO在飞机起飞一小时后发布赴美消息,举家迁往美国

真鸡贼!安踏CEO在飞机起飞一小时后发布赴美消息,举家迁往美国

蜜桔娱乐
2026-08-20 21:23:51
“SHE”成员Selina任家萱近况曝光,体重超160斤,社交账号已经停止使用半年以上

“SHE”成员Selina任家萱近况曝光,体重超160斤,社交账号已经停止使用半年以上

大风新闻
2026-08-21 10:04:35
三国下不来台!朝鲜援俄军火专列被乌炸毁,距黑龙江仅一江之隔?

三国下不来台!朝鲜援俄军火专列被乌炸毁,距黑龙江仅一江之隔?

心灵的触动a
2026-08-21 09:26:32
庄则栋遗孀近况:回北京悼念亡夫,82岁头发全白,26年婚姻感情深

庄则栋遗孀近况:回北京悼念亡夫,82岁头发全白,26年婚姻感情深

娱说瑜悦
2026-08-20 15:16:38
笑不活了!这老爸操作真绝啊,防止高二女儿早恋,直接暑假带闺女跑长沙、武汉旅游,把小姑娘晒成“黑人”

笑不活了!这老爸操作真绝啊,防止高二女儿早恋,直接暑假带闺女跑长沙、武汉旅游,把小姑娘晒成“黑人”

番外行
2026-08-21 09:33:46
刚刚,台风“沙德尔”增强了!浙江发布最新通知:未雨绸缪做好六项前期防御准备工作

刚刚,台风“沙德尔”增强了!浙江发布最新通知:未雨绸缪做好六项前期防御准备工作

都市快报橙柿互动
2026-08-21 11:24:00
*ST广糖公告:公司总经理陆兴愈突发心梗去世,终年56岁

*ST广糖公告:公司总经理陆兴愈突发心梗去世,终年56岁

大风新闻
2026-08-21 12:11:03
中企营地被砸第4天,蒙古部长终于开口:你们砸的是自己的饭碗!

中企营地被砸第4天,蒙古部长终于开口:你们砸的是自己的饭碗!

共工之锚
2026-08-20 00:15:50
祸不单行!被立案调查才9天,53岁郭德纲再迎噩耗,演出全部叫停,网友:天狂有雨,人狂有祸

祸不单行!被立案调查才9天,53岁郭德纲再迎噩耗,演出全部叫停,网友:天狂有雨,人狂有祸

火山詩话
2026-08-21 06:26:08
9月30日倒计时!不涨养老金,却直接锁定往后晚年养老待遇

9月30日倒计时!不涨养老金,却直接锁定往后晚年养老待遇

你在偷看谁
2026-08-20 21:37:11
约基奇砍20+9+8!塞尔维亚男篮险胜法国 文班低迷10分6失误

约基奇砍20+9+8!塞尔维亚男篮险胜法国 文班低迷10分6失误

罗说NBA
2026-08-21 04:28:30
相比于许家印的满头白发,我们更应该看看他曾经的骄奢淫逸

相比于许家印的满头白发,我们更应该看看他曾经的骄奢淫逸

清书先生
2026-08-20 15:59:07
许家印坑惨的10位大佬,马云才排第9,第一名亏360亿遭悬赏

许家印坑惨的10位大佬,马云才排第9,第一名亏360亿遭悬赏

江启
2026-08-21 09:27:12
国运来了谁也挡不住!100年前北洋政府随手签的条约,如今赢麻了

国运来了谁也挡不住!100年前北洋政府随手签的条约,如今赢麻了

兴趣知识
2026-08-19 22:47:37
25岁高盛分析师密谋奸杀前女友,ChatGPT听完“报警”!首例AI送进局子的人诞生了

25岁高盛分析师密谋奸杀前女友,ChatGPT听完“报警”!首例AI送进局子的人诞生了

留学生日报
2026-08-20 20:49:20
AI时代,花不好预算,就做不好品牌

AI时代,花不好预算,就做不好品牌

刀姐doris
2026-08-07 21:49:13
青岛跑步事件比杭州酒局更可怕!网友分析很真实,后续来了

青岛跑步事件比杭州酒局更可怕!网友分析很真实,后续来了

天天热点见闻
2026-08-21 10:57:25
‘永不起床’又火了!樊振东新东家亮相排面拉满 已售3000+票创纪录

‘永不起床’又火了!樊振东新东家亮相排面拉满 已售3000+票创纪录

颜小白的篮球梦
2026-08-21 12:01:03
最好的车,在中国:岚图用六年验证体系写下中国汽车的时代注脚

最好的车,在中国:岚图用六年验证体系写下中国汽车的时代注脚

道哥说车
2026-08-21 09:09:49
社评:《华尔街日报》这个“教师爷”,该下课了

社评:《华尔街日报》这个“教师爷”,该下课了

环球网资讯
2026-08-21 00:14:16
2026-08-21 14:36:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13809文章数 142724关注度
往期回顾 全部

科技要闻

阿里AI的两面:云赚56亿,千问烧掉138亿

头条要闻

特朗普称今年要见金正恩 罕见指出朝鲜有57枚核武器

头条要闻

特朗普称今年要见金正恩 罕见指出朝鲜有57枚核武器

体育要闻

46岁小罗抵达意大利 将为拉文纳征战意丙

娱乐要闻

迪丽热巴与陈飞宇的恋情罗生门

财经要闻

三部门发布多条促内需优化政策

汽车要闻

全新领克20大尾翼版成都车展首次亮相

态度原创

艺术
时尚
房产
本地
游戏

艺术要闻

24 岁一幅画震惊巴黎,他被骂 "对绘画的屠杀"︱欧仁・德拉克洛瓦

白西装,很大气!

房产要闻

265亿资产甩出!三亚老牌地产巨头,正在集体退场!

本地新闻

《牛来》的一声“妈妈”,到底多少人被精神污染了

《昭和米国物语》试玩内容解禁时间官宣!大动作来了

无障碍浏览 进入关怀版