网易首页 > 网易号 > 正文 申请入驻

揭示扩散语言模型扩展定律,人大高瓴团队与蚂蚁集团发布LLaDA MoE v2

0
分享至



本文介绍的工作由中国人民大学高瓴人工智能学院李崇轩、文继荣教授团队与蚂蚁集团共同完成。朱峰琪是中国人民大学高瓴人工智能学院的博士生(蚂蚁集团实习生),导师为李崇轩副教授。

扩散语言模型的快速发展,正成为大语言模型领域备受关注的技术方向:凭借双向上下文建模与多词元并行解码的独特优势,这一新兴范式已从前沿学术探索逐步成长为大语言模型的重要技术路线之一,受到学术界与产业界的持续关注。随着模型规模与训练算力不断增大,如何高效地扩大规模成为亟待回答的问题 —— 最优超参数如何随算力调整、有限算力在模型与数据间如何分配、稀疏专家架构如何随规模演进,都需要扩展定律给出科学的答案。

在自回归模型上,扩展定律已相当成熟,支撑了一代又一代大模型的训练;然而,离散扩散语言模型采用掩码去噪目标,监督信号仅落在被掩码的位置,每个预测又都基于受损序列而非因果前缀,自回归的扩展经验无法直接照搬。混合专家架构作为大模型扩容的主流选择,与扩散建模结合后的扩展规律仍缺乏系统刻画,大规模扩散语言模型的训练仍在很大程度上依赖经验与试错。

为此,高瓴人工智能学院李崇轩、文继荣团队与蚂蚁集团首次系统刻画了混合专家扩散语言模型的扩展定律,并据此从头训练了 30B-A3B 的新一代扩散语言模型 LLaDA MoE v2。该工作将扩展定律贯穿超参数配置、算力分配与架构设计,标志着扩散语言模型从 “经验驱动” 迈向 “定律指引” 的关键一步:LLaDA MoE v2 激活约 3B 参数,仅用同规模自回归模型 Qwen3 30B-A3B 约 65% 的预训练词元,即在知识、推理、代码等多项基准上逼近 Qwen3 水准,且仅经有监督微调便在 8 项推理与代码基准中的 7 项超越现有领先扩散模型,实现扩展效率与智能的双重突破,标志着扩散语言模型迈入 “定律指引、稀疏并行、高效扩展” 的规模化时代。



  • 论文标题:LLADA MOE V2: SCALING MIXTURE-OF-EXPERTS DIFFUSION LANGUAGE MODELS
  • 论文链接:https://arxiv.org/pdf/2608.03457

团队预计近期将开源推理代码以及 LLaDA MoE v2 模型权重。

在优化超参数方面,联合团队在 158M 至 3.6B 的模型规模与至FLOPs 的算力跨度上系统搜索批量大小与学习率,拟合出扩散语言模型专属的超参数扩展定律:最优批量大小随算力的增长比自回归模型更陡,最优学习率随算力的衰减更快。在FLOPs 算力下,自回归定律预测的最优批量大小约为 102 万词元,而新定律给出 343 万词元 —— 这一差异源于掩码去噪目标下,名义词元仅在被掩码时才贡献监督信号,有效监督强度的下降改变了梯度噪声水平与优化稳定性。该定律在FLOPs 的外推验证中与实测最优配置高度吻合,为大规模训练提供了可靠的超参数标尺。



图 1:LLaDA MoE v2 的超参数扩展定律:最优批量大小(左)与最优学习率(右)随训练算力的扩展曲线,红色虚线为本文拟合定律,蓝色虚线为自回归模型参考定律

在算力分配方面,团队通过 IsoFLOP 分析刻画了固定算力下模型规模与训练数据的最优权衡:最优模型侧算力随总算力以 0.475 次幂增长,最优训练词元数以 0.525 次幂增长,整体接近均衡并略微偏向数据一侧。与已有稠密扩散模型的扩展定律相比,混合专家扩散模型的分配前沿是迄今最偏向数据侧的,稀疏激活与扩散建模各自带来的 “亲数据” 倾向在其中叠加显现,意味着边际算力投向训练词元比投向模型侧计算更为划算。



图 2:LLaDA MoE v2 的算力分配扩展定律:固定算力下模型 - 数据分配的 IsoFLOP 曲线(左),以及最优模型侧算力(中)与最优训练词元数(右)随总算力的幂律前沿

在架构设计方面,团队沿激活比例、专家粒度与共享专家比例三个关键维度解析了混合专家架构的扩展规律:随着规模扩大,更低激活比例、即更大的路由专家池愈发占优;8 至 16 的中等专家粒度在各规模下均保持稳健;共享专家承载约三分之一激活容量(33.3%)在所有规模下恒为最优,与自回归混合专家模型惯用的 25% 甚至不设共享专家的经验形成鲜明对比,由此得到了扩散语言模型专属的稀疏激活架构设计准则。



图 3:混合专家架构的扩展规律:激活比例(a)、专家粒度(b)与共享专家比例(c)在不同算力规模下的受控扫描,红星标记各规模的最优配置

在上述扩展定律的指引下,联合团队从头训练了 LLaDA MoE v2 30B-A3B 模型:总参数 30B、每词元激活 3B 参数,采用 128 个细粒度路由专家,激活比例 9.09%、专家粒度 8、共享专家比例 33.3%,落在扩展定律给出的最优区间。模型经五阶段预训练累计学习 23.5T 词元,全程消耗约 46 万 NVIDIA B200 GPU 小时。在 15 项基准测试中,LLaDA MoE v2 取得扩散语言模型中的最高平均分 58.60,较同规模扩散模型 SDAR Sci 高出 3.78 分,其中 HumanEval 与 BigCodeBench 分别领先 16.46 分与 7.98 分;与自回归模型 Qwen3 相比,模型在 OlympiadBench、HumanEval 等多项推理与代码基准上的差距不足 3 分,而预训练词元用量仅为其约 65%。



图 4:LLaDA MoE v2 基座模型与其他扩散语言模型和自回归模型在 15 项基准上的核心指标对比

扩展定律的指导价值在算力效率上体现得尤为直观:与未受扩展定律指引的上一代 LLaDA-MoE 7B-A1B 相比,LLaDA MoE v2 在 MMLU、GSM8K 和 KorBench 上仅以约一半的训练算力便实现超越,展现出 “定律指引” 将预训练算力高效转化为下游性能的路径。



图 5:扩展定律指引的 LLaDA MoE v2 在多项基准上以更少训练算力达到并超越上一代 LLaDA-MoE

在有监督微调方面,团队使用 700 万条指令数据进行训练,所得模型即在 8 项数学推理与代码生成基准中的 7 项上超越同规模扩散模型 SDAR Chat,并在 AIME 2024/2025、MBPP、LiveCodeBench 等基准上逼近经历额外强化学习阶段的 Qwen3,更在多语言代码生成基准 MultiPL-E 上实现反超,表明扩展定律指引的基座模型经简单微调即可释放扎实的指令遵循与复杂推理能力。



图 6:LLaDA MoE v2 指令微调模型与 Qwen3 和 SDAR Chat 在推理与代码基准上的核心指标对比

LLaDA MoE v2 首次为混合专家扩散语言模型建立了覆盖超参数、算力分配与架构设计的系统性扩展定律,突破了非自回归模型规模化依赖经验迁移的瓶颈。通过定律指引的稀疏架构与掩码去噪训练,模型以更少的预训练词元与更低的激活开销逼近同规模领先自回归模型,为扩散语言模型的规模化提供了 “定律指引”,为进一步扩大模型规模、探索智能上限铺平了道路。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
葛卫东这笔10亿元投资,半年浮亏超50%, 牛散章建平此前已“割肉”

葛卫东这笔10亿元投资,半年浮亏超50%, 牛散章建平此前已“割肉”

每日经济新闻
2026-08-12 07:32:28
公安部网安局公布打击侵犯公民个人信息犯罪10起典型案例

公安部网安局公布打击侵犯公民个人信息犯罪10起典型案例

界面新闻
2026-08-11 08:10:28
越南少将坦言:如果当时中国军队在谅山再多待五天,布防在那里的越军,不是被打散的问题,而是从建制上被彻底抹掉的问题, 一个都不剩下

越南少将坦言:如果当时中国军队在谅山再多待五天,布防在那里的越军,不是被打散的问题,而是从建制上被彻底抹掉的问题, 一个都不剩下

人生录
2026-08-08 00:05:22
1998年数万华人遭屠杀,中国为何没出兵?26年后答案让人沉默

1998年数万华人遭屠杀,中国为何没出兵?26年后答案让人沉默

哄动一时啊
2026-02-17 22:21:25
中方对美国立规矩:不配合调查者将支付更多费用

中方对美国立规矩:不配合调查者将支付更多费用

花寒弦絮
2026-08-11 13:53:02
伦敦警察“被迫含泪”驾驶370万英镑限量法拉利:车主无驾照,警员拒绝拖车,亲自开回警局

伦敦警察“被迫含泪”驾驶370万英镑限量法拉利:车主无驾照,警员拒绝拖车,亲自开回警局

全球吃瓜现场
2026-08-11 15:12:06
三峡大坝收支出炉了:运行20余年,总投资近2500亿,如今回本了吗

三峡大坝收支出炉了:运行20余年,总投资近2500亿,如今回本了吗

蜉蝣说
2026-07-31 09:48:05
河南杀疯了!官宣10.01克拉珍稀绿钻,全球仅2颗,品质当世最佳!

河南杀疯了!官宣10.01克拉珍稀绿钻,全球仅2颗,品质当世最佳!

果壳
2026-08-11 19:03:05
杀青8年终过审!周星驰《美人鱼2》或2027春节上映,星爷还在等

杀青8年终过审!周星驰《美人鱼2》或2027春节上映,星爷还在等

易象君
2026-08-10 20:38:24
俄罗斯末日电台突发异动!罕见全天播报暗语,惊现炮兵师和厕所

俄罗斯末日电台突发异动!罕见全天播报暗语,惊现炮兵师和厕所

风干迷茫人
2026-08-11 19:24:39
罗马诺:我可能不会再以这种方式在转会行业继续太久了

罗马诺:我可能不会再以这种方式在转会行业继续太久了

懂球帝
2026-08-11 16:29:25
尴尬!要求主持人下课!河南媒体连线采访朱女士,数百万人围观,因提问方式引巨大争议

尴尬!要求主持人下课!河南媒体连线采访朱女士,数百万人围观,因提问方式引巨大争议

火山詩话
2026-08-11 06:26:29
女子揭秘“饿两天定律”,体重狂掉33斤,瘦到100斤

女子揭秘“饿两天定律”,体重狂掉33斤,瘦到100斤

解说阿洎
2026-08-02 14:28:56
“好标准的一脸苦相!”三姐妹和妈妈合照,看着就觉得命苦!

“好标准的一脸苦相!”三姐妹和妈妈合照,看着就觉得命苦!

世界圈
2026-07-30 08:40:29
流浪猫只是陪醉酒的人坐了一晚,没想到第二天直接喜提新家!

流浪猫只是陪醉酒的人坐了一晚,没想到第二天直接喜提新家!

拜见喵主子
2026-08-10 22:11:20
海淀区2026人才引进名单曝光:234人里,藏着学历内卷的残酷真相

海淀区2026人才引进名单曝光:234人里,藏着学历内卷的残酷真相

解说阿洎
2026-08-12 02:06:42
叙利亚前总统巴沙尔·阿萨德被叙法院缺席审判判处死刑,其与家人前年已赴俄罗斯避难

叙利亚前总统巴沙尔·阿萨德被叙法院缺席审判判处死刑,其与家人前年已赴俄罗斯避难

界面新闻
2026-08-11 18:44:28
重庆楼市的残酷真相:50万卖房背后,是无数家庭的希望被碾碎

重庆楼市的残酷真相:50万卖房背后,是无数家庭的希望被碾碎

靓仔情感
2026-08-12 01:12:29
目不识丁、脑袋空空?易烊千玺获奖后的发言,给流量明星上了一课

目不识丁、脑袋空空?易烊千玺获奖后的发言,给流量明星上了一课

可乐谈情感
2026-08-11 06:46:00
不是迷信!七月初一“地门开”,这7大禁忌切记别犯,为家人祈福

不是迷信!七月初一“地门开”,这7大禁忌切记别犯,为家人祈福

简食记工作号
2026-08-12 01:33:35
2026-08-12 09:47:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13733文章数 142718关注度
往期回顾 全部

科技要闻

AI大战变天:扎克伯格突然回头

头条要闻

"我听交警的"事件最新进展:逆行女子被判道歉并赔偿

头条要闻

"我听交警的"事件最新进展:逆行女子被判道歉并赔偿

体育要闻

NBA老顽童,抽着大麻喝着小酒告别了

娱乐要闻

陈思诚恋情疑云再起

财经要闻

李嘉诚,再一次大撤退!他嗅到了什么?

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

本地
数码
时尚
公开课
军事航空

本地新闻

黄州一夜,苏轼写给普通人的月光

数码要闻

Satechi推出240W ChargeView桌面充电器 配备六个USB-C接口与实时功率显示

百花奖,不渡85花

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

通过“毕业大考” 湖北舰“持证上岗”

无障碍浏览 进入关怀版