![]()
新智元报道
![]()
刚刚,「中国版Thinking Machines Lab」诞生!
全球语音与交互界,骤然杀出一家撼动格局的硬核AI初创。
它,就是宇生月伴(VUI Labs)。
在语音界最权威榜单之一的Hugging Face TTS Arena上,VUI Labs的Luna-TTS 模型力压群雄,击败了ElevenLabs,以及MiniMax、Cartesia等国内外明星大厂,强势登顶全球第一!
![]()
在独立AI评测平台Artificial Analysis的Speech Arena榜单上,它直接超越了谷歌,获得全球第三!
![]()
这家大放异彩的中国硬核 AI 初创公司,愿景清晰而宏大——从高精度的 TTS 语音模型切入,以语音作为最具自然感与即时性的交互入口,最终贯通多模态,打通全双工的 Voice Agent闭环。
无论是以语音为突破口构建新一代交互范式,还是通过实时语音反馈倒逼多模态基座能力的演进,它都展现出了与 Thinking Machines Lab 较为相似的路线。两家公司的路线,竟然不谋而合。
现在,VUI Labs拿出的语音模型发布不久,就一举横扫了全球权威榜单,锋芒毕露,势不可挡。
击败巨头登顶全球TOP 1,
Luna-TTS 模型凭什么?
下面这段《人民的名义》中高育良和侯亮平的对话,背后到底是不是真人?
要是不告诉你答案,打赌你猜不出来。
同理,这个视频,也是真人AI傻傻分不清。
英文的球赛解说,对物理发声细节还原得很真实,听觉体验直接拉满。
给自然纪录片配音,毫无违和感,仿佛背后真有个配音演员。
用在科技旁白的解说里,也是十分丝滑。
为什么现在的语音 AI 已经很好听了,但在情绪激动时依然偏生硬,操着不自然的播音腔?
这并非主流的自回归(AR)模型不够强大,而是它「从左到右逐字生成」的文本逻辑,难以充分刻画声音中多个维度同时变化的复杂性。
人类说话时,情绪、音色、呼吸是全局交织的;而 AR 架构强制单向顺序生成,不仅拉高了长句的延迟,还极易引发「一步错、步步错」的累积误差。
为了突破这一机制天花板,VUI Labs 拿出的王牌 Luna-TTS,提供了一条全新的破局路线,彻底颠覆了这种传统架构。
![]()
Luna-TTS 把传统「逐Token生成语音」的路线,改造成了一套更像扩散模型的语音生成系统,同时还专门做了一条实时流式分支。
具体来说,它先把声音压缩成适合语言模型处理的离散Token,再让一个基于Qwen3改造的 Diffusion LM一次并行预测大量语音Token;需要实时对话时,则进一步改造成按块生成的Luna-TTS Realtime。
架构改造后,取得的结果惊人。
![]()
arxiv:https://arxiv.org/abs/2608.11593
github demo page:https://vuilabs-ai.github.io/luna-tts
六项指标全球第一
Luna-TTS在「像真人」的五个层面上,都做到了非常突出的自然与稳定。
![]()
它说得准确,发音、断句和语句衔接都很自然连贯。
它的语流中包含足够的抑扬顿挫,轻重缓急恰到好处。
更难得的是,它能根据不同语境切换情绪——在惊喜、克制、失落或调侃的状态下,会呈现完全不同的声音。每一句话,都仿佛带着温度。
人类的换气、犹豫、轻笑、叹气,以及说话过程中细微的情绪变化,构成了真实交流的质感,而Luna-TTS把这些信息,都呈现在了声音中。
即使是长语音文本,它也依然能稳定表达。
而且,它的音视频克隆能力也是直接拉满。只需几分钟的样本,就能复刻出说话人的音色、语气甚至呼吸节奏,简直以假乱真。
比如亮剑中经典的意大利炮情节。
以及诸葛亮在两军阵前痛斥王朗的名场面。
这段《教父》的汉化版配音,真的绝了,完全还原出了原配音中的味道,沧桑又有压迫感。
六个第一的含金量:四项语音质量指标+两项模型效率指标
在最新的技术报告中,Luna-TTS不仅在Seed-TTS-Eval评测中关于语音质量的四项指标全拿第一(显著优势超越了字节Seed、MiniMax、智谱和Qwen系列等),更是在「野外」复杂环境下的CV3-Eval评测中,展现了惊人的纠错与抗噪能力。
![]()
![]()
这四个第一,含金量超高。
除了语音质量的性能指标上,它还在首包延迟和实时率两个效率指标上,也是第一。
总结来说,就是语音质量最好、生成效率最高、首包延迟最低。
![]()
首包延迟全球第一
![]()
端到端实时率(RTF)位列第一
它到底牛在哪里?核心就在于以下突破。
架构演进:从预训练 AR 语言模型到 Block Diffusion 的「三步走」
在 TTS 领域,从基座语言模型初始化,是业界公认的有效范式。文本大模型天然具备强大的多语言文本理解、字词对齐、拼写规则以及复杂语种(如日韩语)的书写系统建模能力。
因此,团队并没有从头训练声学模型,而是从Qwen3-0.6B出发,设计了一套清晰的渐进式改造路线。
![]()
在 CV3-Eval 等 Benchmark 中,存在大量长句、不规则标点及复杂口语等「难文本」。
面对这种难文本,双向扩散架构是更合适的。
原因就在于,AR模型自身有很大的局限性。
自回归模型采用左到右的 Next-Token 预测,一旦前期采样出现微小偏差,错误就会在 Prefix 中永久冻结并滚雪球式累积,导致 TTS 常见的跳字、重复和吞音。
这就体现出了双向 Diffusion的优势:TTS 与自由文本生成不同,其输出音频的语义内容本质上被输入文本高度约束。
双向掩码扩散,允许模型在去噪过程中同时看到全局的过去和未来上下文,通过多步置信度精炼动态修正局部错误,这就大幅消除了暴露偏差。
Tokenizer 创新:Luna-Codec 的「语义锚定」与声学解耦
第二点,就是Tokenizer的创新。
在多码本 Residual Vector Quantization神经编解码器中,如果直接进行端到端重构训练,前几个码本(Codebooks)往往会过早卷入细微的频谱细节,导致文本向音频 Token 的预测极其不稳定。
为此,Luna-Codec采用了8 码本架构,在24kHz的采样率下达到了25Hz帧率(每秒 200 个 Token)。
![]()
在训练 Tokenizer 时,团队通过引入额外的预训练 WavLM 语义蒸馏 Loss,将语言/语义信息强行「锚定」在第一层码本(CB1)中。
CB1 负责提供稳定的语言/字音骨架,剩下的 CB2–CB8 码本则自由捕获音色、环境声道、情绪和韵律细节。
这种从「语义到声学」的层次化设计,大幅降低了扩散模型从文本预测完整音频网格的难度。
强化学习突破:离散掩码扩散模型上的 GRPO 迁移
Luna-TTS的核心算法创新之一,是将基于GRPO的强化学习后训练,成功迁移到非自回归离散掩码扩散模型上。
在传统的自回归语音模型中,策略梯度更新可以顺理成章地沿着「从左到右」的链式概率分解进行。
然而,Luna-TTS作为一个非自回归掩码扩散模型,是通过多步迭代去噪并行生成音频网格的,无法直接按链式法则计算输出概率。
为了破解这一难题,Luna-TTS成功将 GRPO 迁移到了离散掩码扩散模型上,其核心在于轨迹感知与字典序奖励。
![]()
Block Diffusion 与工程落地
为了满足全双工 Agent 和实时交互场景,团队提出了 Luna-TTS Realtime实时语音合成方案。
![]()
在这个过程中,语音不是逐帧生成的,而是切成一个个 1.28秒(32帧) 的小块。块之间采用自回归方式(支持KV Cache加速),块内部则用 8~16步并行去噪 一次生成32帧和8个码本,效率极高。
它的实测性能非常惊艳,在2张H20 GPU 上开启并行CFG部署时,首包延迟(TTFT)只需 41.6毫秒,就能生成并解码出第一个1.28秒的音频块,几乎感觉不到等待。
实时倍率(RTF)低至 0.024,也就是生成1秒语音仅需24毫秒,超过40倍实时速度,完全满足流畅对话需求。
为了让长文本朗读、全双工对话等商业化场景真正跑通,团队在工程侧做了几项关键配套。
比如,他们做了推理同步与显存优化,借助 vLLM-Omni 框架,实现显存解耦和流式Chunk递交,保证长时推理不爆显存、响应平稳。
另外,团队还做了文本正则化:针对特殊符号、数字等「模型容易读错」的文本,构建了一套完善的前端预处理模块,确保无论输入多复杂,模型都能「读得对、读得顺」。
数据工程与真实情感控制
Luna-TTS之所以能在对话听感和表现力上超越 ElevenLabs 等,核心在于百万小时级的极致数据工程与专项退火微调。
首先,在让模型学会「表达情感」之前,团队构建了一个规模高达100万小时的精调多语言语音语料库,涵盖了中文(43.4%)、英文(43.1%)以及日语和韩语(合计 13.6%)。
其次,团队精选出约10万小时的「极高质量」语音子集进行退火训练,极大提高了语音的保真度、鲁棒性和自然韵律。
最后,在第三阶段的训练中,团队引入了带有精细标注的表达性语音数据。
这些标注不光是简单的话语级情绪标签(如 [happy] 开心、[angry] 生气、[sad] 悲伤),更创新性地加入了行内非语言发音标签(NVV),例如 [laughs](笑声)、[sighs](叹息)、[gasps](喘息)、[coughs](咳嗽)等。
![]()
这些控制标签不是额外接个模块,而是直接当作文本提示输入给模型,不需要额外的风格编码器或控制头。
这样一来,模型就能在正确的文本位置,自然地带出呼吸、叹息、情绪起伏,听起来更像真人,而不是机械地念稿子。
就这样,Luna-TTS成功在TTS领域实现了「高品质表现力」与「工业级极低延迟」的统一。
它既有情感表现力,又能满足实时场景的低延迟要求,让扩散语音生成到达了新的天花板。
左手顶尖科学家,右手商业操盘手:
一支造梦铁军
在AI大模型这条拥挤的赛道上,拼算力、拼参数固然重要,但归根结底拼的是人。
VUI Labs之所以能在极短的时间内拿出登顶全球的技术,离不开豪华的核心团队。
如果用一个词来形容VUI Labs的基因,那就是:双核驱动。
其中一核,是绝对顶级的科研实力。
VUI Labs创始人兼董事长钱彦旻教授,是上海交通大学计算机学院和人工智能学院特聘教授。
![]()
这位年仅38岁就入选教育部长江学者的顶尖科学家,履历非常优秀:清华大学电子工程系博士,剑桥大学机器智能实验室博士后;国家优秀青年科学基金获得者;首位交大睿远青年科技奖-信息与空间奖得主。长期专注于语音对话与多模态交互技术的研究与产业化落地。
更以第一完成人的身份,斩获了中国人工智能界的最高荣誉——吴文俊人工智能自然科学一等奖。
在端到端语音模型这个细分且极具壁垒的领域,钱教授带领的科研团队近5年论文引用量高居全球第3、全国第1!
现在,他已经发表论文超350篇,Google Scholar引用超20,000次。在国际语音技术界,他是公认的探路者,还担任了IEEE SLTC国际语音和语言技术委员会评奖委员会主席。
另一核,则是惊人的商业变现能力。
科技成果不能只停留在实验室的展示架上。VUI Labs的创始人兼CEO梅杰,是一位拥有极强商业嗅觉的连续成功创业者。
![]()
在2017至2022年担任Aircourse/爱课COO期间,他用短短3年时间,将公司年营收干到了5亿元以上,管理着800人的庞大团队。
他最擅长的,就是将前沿技术转化为可交付的行业产品,打通从POC验证到规模化上线的「最后一公里」。
除了这两位灵魂人物,VUI Labs还汇聚了一批「天才大脑」。整个研发团队近50人,博士占比高达50%。
这样一支既懂前沿算法,又懂工程落地,更懂商业闭环的全能战队,为打造「Thinking Machines Lab」奠定了最坚实的底座。
7400亿美元的市场:让AI真正打工赚钱
VUI Labs从第一天起就瞄准真实商业场景。
为此,他们构建了清晰的三层产品体系:
模型API:提供语音生成、声音克隆、识别转写、实时翻译等底层能力,性能达到全球顶尖水平,服务稳定可靠;
创作者和开发者平台:提供配音创作、长文本合成、多角色演绎、声音管理与项目导出等工具,并融合图片、视频、音乐生成能力,覆盖从创意到成片的完整创作流程;
语音Agent平台:打通语音识别、语言模型、工具调用与语音生成,提供从场景梳理、知识库配置、低延迟对话编排到部署上线的全流程服务,帮助企业快速搭建可对话、能执行任务的语音 Agent。
这套务实打法已在物流调度、互联网保险、酒旅SaaS等场景规模化落地,数家客户累计完成超100万次真实业务对话。
Luna-TTS在这些场景里是名副其实的「超级员工」——做客服、做销售、做会议助理,能做同传级翻译,也能当座舱管家。
据测算,到2030年,语音+视觉+协作三层能力将撑起2660亿至7400亿美元的市场。
VUI Labs,正稳站在这个入口。
中国AI的下一场战役:
成为人类的「AI Teammate」
未来的世界,我们不需要更多的冷冰冰的问答机器人,我们需要的是像人类一样自然呼吸、思考、协作的AI语音。
宇生月伴正在用他们全面SOTA的技术,向世界证明:在AI语音这个赛道上,中国团队正在引领全球。
中国版的Thinking Machines已经到来。它正在各行各业的隐秘角落里,悄悄上岗。
这一次,最自然的交互方式,将成为商业世界中最强大的生产力。
最后,VUI Labs的官网地址:http://vuilabs.cn/。点击「阅读原文」,赶快去体验吧!
编辑:Aeneas
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.