网易首页 > 网易号 > 正文 申请入驻

小米AI新论文!雷军千万年薪要挖的DeepSeek天才少女署名

0
分享至

智东西10月15日消息,10月14日,小米和北京大学联合署名的论文发表于arXiv,曾被曝获小米集团创始人兼CEO雷军以千万年薪招募的DeepSeek“天才少女”罗福莉,出现在了这篇论文的通讯作者之列,但值得注意的是,论文作者中并没有标注罗福莉属于小米大模型团队

通讯作者中的罗福莉是95后,她本科就读于北京师范大学计算机专业,硕士毕业于北京大学计算语言学研究所计算语言学专业。随后罗福莉曾在阿里巴巴达摩院主导开发了多语言预训练模型VECO,并推动了AliceMind的开源工作,2022年入职DeepSeek,参与了MoE大模型DeepSeek-V2的研发。去年年底,小米被曝以千万年薪挖角DeepSeek-V2核心开发者之一罗福莉,使其冲上热搜,但双方至今都未公开声明是否正式入职小米。

▲DeepSeek“天才少女”罗福莉(图源:罗福莉个人公众号)

这篇论文提出了提升MoE模型强化学习训练的新方法Rollout Routing Replay(R3)。实验结果证明,R3的整体性能优于GRPO、TIS这类强化学习领域提升模型性能的优化算法,且引入R3的所有组合方法全过程无崩盘,训练过程中训练-推理KL散度等始终较低,在不影响训练速度的情况下,使得极端token比例减少一个量级。

当下,强化学习(RL)已成为提升大语言模型能力的关键方法。然而,在MoE模型中,路由机制往往会引入不稳定性,甚至导致强化学习训练崩溃,但现有的引入重要性采样机制等并不能提升训练稳定性。不同于此前采取诸如丢弃差异较大的数据之类的变通方法,这篇论文的研究人员希望通过解决路由分布也就是R3来根本性解决这个问题。

论文地址:https://arxiv.org/pdf/2510.11370

一、破解强化学习崩溃的关键方法,小米团队提出R3

强化学习已成为大语言模型后期训练的基石,利用大规模强化学习,大模型更深入、更广泛推理,获得解决复杂问题所需的高级能力,但其面临的关键挑战是如何平衡效率和稳定性。

现代强化学习框架通常使用不同的引擎进行推理和训练用于部署,但这种架构上的分离可能导致token概率出现分歧,甚至可能导致灾难性的强化学习崩溃。然而,现有的改进方法并不能完全解决MoE模型上进行强化学习训练时出现的强化学习离线策略问题。

研究人员提出的R3,其工作原理是在序列生成期间从推理引擎捕获路由分布,并将其直接重放到训练引擎中。这一过程可以缩小训练和推理之间的差距,其显著特征是不同引擎生成的逻辑向量的KL散度(量化两个概率分布之间的差异程度,值越小说明两个分布越接近)显著降低,两个阶段之间概率差异显著的token数量减少了大约一个数量级。

此外,该方法同时适用于在线策略(on-policy)和小批量(mini-batch)式离线策略强化学习(off-policy)场景。

论文提到了研究团队的三大主要贡献:

1、系统识别和分析了MoE模型中训练和推理之间的路由分布差异,强调了它们在训练不稳定性中的作用;

2、提出Rollout Routing Replay,它重用训练引擎内部的推理时间路由分布,以协调训练和推理之间的路由行为;

3、将R3应用于多种RL设置进行MoE强化学习,并表明R3在稳定性和整体性能方面优于GSPO和TIS。

二、可显著缩小训练-推理差异,对Agent任务大有裨益

R3的主要思路是在训练前向传播过程中重用推理路由掩码I,同时仍将softmax应用于训练逻辑以保持梯度流。

这种设计主要有两个目的:一是对齐训练和推理,确保训练重放期间使用的专家与推理期间选择的专家相匹配,从而消除专家选择中的不匹配;二是保留梯度数据流,通过仅重放掩码,梯度仍然可以流回logits而不会干扰计算图,这有助于有效地优化路由器。

▲重放门控权重、重放输出y的计算方式

具体来看,R3在效率优化上,通过路由掩码缓存(Router Mask Caching)适配多轮对话场景,降低计算开销

其论文提到,缓存的路由掩码具有相似的属性,对于相同的前缀token,MoE路由器应该产生相同的结果,因此来自推理引擎的路由掩码可以与前缀KVCache一起缓存。

对于每个层和token前缀,相应的路由掩码都存储在KVCache中。当相同的前缀出现并命中缓存时,这些掩码可以被重用,从而无需重新计算,这使得R3能够与前缀缓存机制无缝集成。

研究人员称,缓存路由掩码在Agent场景中有较大应用空间。例如软件工程和网页浏览等Agent任务,都涉及自回归生成和工具调用之间的多轮交互,为了提高效率,这些过程直接重用了前几轮的KVCache,因此无需重新生成已计算的数据。路由掩码缓存使R3能够在强化学习代理任务中保持高效,而无需重新预填充以生成路由掩码。

为了证明R3在缩小训练-推理差异上的有效性,研究人员使用Qwen3-30B-A3B模型进行了验证,其将推理过程中获得的路由分布缓存在SGLang上,并在Megatron框架内重放它们。

▲使用Megatron进行两次前向传播获得的概率

结果表明,应用R3后,训练和推理之间的KL散度从1.5×10⁻³减小到7.5×10⁻⁴,接近于稠密模型的6.4×10⁻⁴水平,这表明其训练-推理差异减少。

研究人员还绘制了使用R3的训练-推理差异比率的累积分布图,对于MoE模型,应用R3可将具有较大训练推理差异的token的频率降低一个数量级。

▲a、MoE模型中训练-推理差异的说明,b、MoE+R3模型中训练-推理差异的说明,c、稠密模型中训练-推理差异的说明,d、极端token分布函数

三、实测三大能力提升:整体性能、训练稳定、优化生成行为

为了评估R3对强化学习的性能改进,研究人员从BigMath、ORZ等开源数据集筛选约10万道可验证数学题,采用AIME24、AIME25、AMC23和MATH500作为基准数据集进行评估,并在单次训练过程中每5个全局步骤测量一次模型性能。

其选择的模型是Qwen3-30B-A3B-Base及其微调模型Qwen3-30B-A3B-SFT。

评估方式是每5个全局步骤记录模型性能,最终报告最佳性能及对应训练步骤,若模型后期性能骤降,同时追踪训练崩盘步骤”。

实验结果表明,整体性能上,R3在多步更新场景,GRPO+R3平均得分68.05分,比GSPO高出1.29分;GSPO+R3进一步提升至69.00,比单独GSPO高2.24分。

单步更新场景,SFT模型上,GRPO+R3平均得分71.83分,比GRPO(62.23)高9.6分,比GRPO+TIS(66.24)高5.59分;Base模型上,GRPO+R3平均得分70.73,比GRPO(61.69)高9.04分。

▲主要评估结果

研究人员还发现,将R3与TIS结合使用并不能带来明显的性能提升,甚至可能降低性能,例如在SFT模型的单小步设置下,TIS+R3的得分比单独使用R3低1.69分。由于R3已经显著降低了训练和推理之间的策略差异,因此TIS的额外校正效果微乎其微。

训练稳定性方面:如GRPO、GRPO+TIS等无R3的方法在单步更新场景中均出现崩盘,GRPO在60步崩盘、GRPO+TIS在105步崩盘。

引入R3后,所有组合方法均无崩盘,且训练过程中训练-推理KL散度等始终较低。

▲多步更新训练-推理崩溃分析

优化与生成行为方面,在训练过程中,R3还能增强优化稳定性、探索行为和生成动态。下图是研究人员绘制的单步+基础模型组训练过程中的序列长度、梯度范数、生成熵和评估分数。

▲wen3-30B-A3B-Base训练动态

结果显示,R3具有更小的梯度范数、更平滑的序列增长模式和更稳定的熵。实验中使用R3时,生成的序列长度在训练开始时迅速上升,表明R3能够快速捕捉到正确的优化方向,相比之下其他两个训练过程在第80步之后才缓慢上升,并且波动更为明显;R3始终保持较低的梯度范数,表明优化过程更加稳定;实验使用R3时,熵在大约第25步后开始稳步上升,表明模型更早地开始探索更优策略,不使用R3时,熵上升得更晚,并且波动较大。

结语:聚焦MoE模型训练难题,小米提出新思路

MoE架构如今已成为扩展现代语言模型的基石,其采用门控网络,对每个token稀疏地仅激活一部分专家参数,从而将模型的总参数数量与其推理成本分离开来,从而大幅提升了模型容量。然而,由于门控网络的敏感性,MoE模型容易受到训练不稳定性的影响,这使得路由稳健性成为有效模型收敛的核心挑战。

在这篇论文中,研究人员在训练过程中重用推理时的路由分布,以在保留梯度流的同时对齐专家选择。这种思路或为行业提供了新的研究思路。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
膈应啊!一老人带着逝者骨灰乘动车返乡,全程在车厢撑着一把黑伞,引发热议

膈应啊!一老人带着逝者骨灰乘动车返乡,全程在车厢撑着一把黑伞,引发热议

火山詩话
2026-07-23 10:55:57
谢贤离世!前女友Coco已回河南老家,相亲屡屡碰壁,或孤独终老

谢贤离世!前女友Coco已回河南老家,相亲屡屡碰壁,或孤独终老

麓谷隐士
2026-07-23 07:45:03
新药来了!全球首个口服“降脂针”获批,每日一片、降幅最高60%

新药来了!全球首个口服“降脂针”获批,每日一片、降幅最高60%

科技处长
2026-07-23 10:47:02
谢贤送别仪式最戳人 最让人破防的是,工作人员曝出的一个细节:仪式结束后,张柏芝独自留在灵前,摆上了一碗亲手熬煮的陈皮红豆沙

谢贤送别仪式最戳人 最让人破防的是,工作人员曝出的一个细节:仪式结束后,张柏芝独自留在灵前,摆上了一碗亲手熬煮的陈皮红豆沙

市井大实话
2026-07-22 11:05:11
打脸黑子!中国女排3-2美国女排 赛后听听球员和教练怎么说

打脸黑子!中国女排3-2美国女排 赛后听听球员和教练怎么说

南海浪花
2026-07-23 21:57:32
王虹获奖后感言:很幸运能够在合适的时间遇见合适的人,得到正确的引导

王虹获奖后感言:很幸运能够在合适的时间遇见合适的人,得到正确的引导

澎湃新闻
2026-07-23 23:16:27
“黑吃黑”!瑞银前银行家被判10年监禁,上诉被香港高院驳回!其私吞卖淫团伙头目约1.3亿港元,在伦敦买楼,还登记了6辆豪车

“黑吃黑”!瑞银前银行家被判10年监禁,上诉被香港高院驳回!其私吞卖淫团伙头目约1.3亿港元,在伦敦买楼,还登记了6辆豪车

每日经济新闻
2026-07-23 20:16:03
长沙曾琦医生入职浙大四院,担任专科专家,引发争议!网友:曾医生也算是因祸得福,看中她的“知名度”

长沙曾琦医生入职浙大四院,担任专科专家,引发争议!网友:曾医生也算是因祸得福,看中她的“知名度”

火山詩话
2026-07-22 08:09:06
不是庄宇珊不是龚翔宇,击败美国最大功臣是32岁老将,调度太出色

不是庄宇珊不是龚翔宇,击败美国最大功臣是32岁老将,调度太出色

南海浪花
2026-07-23 22:57:06
创造奇迹!随着中国3-2美国,女排总决赛四强出炉,具体对阵如下

创造奇迹!随着中国3-2美国,女排总决赛四强出炉,具体对阵如下

侃球熊弟
2026-07-23 21:45:30
金融圈大瓜!网传一证券公司女销售居家线上会议,忘关摄像头,其赤裸上身、刷牙洗漱的私密居家画面,被实时投射至会场大屏

金融圈大瓜!网传一证券公司女销售居家线上会议,忘关摄像头,其赤裸上身、刷牙洗漱的私密居家画面,被实时投射至会场大屏

火山詩话
2026-07-23 06:24:03
世联赛疯狂一夜,3-1,3-2,总决赛四强对阵出炉,中国女排大逆转

世联赛疯狂一夜,3-1,3-2,总决赛四强对阵出炉,中国女排大逆转

侃球熊弟
2026-07-23 22:04:45
击败强敌!中国女排3比2胜美国女排,闯进世界女排联赛四强

击败强敌!中国女排3比2胜美国女排,闯进世界女排联赛四强

澎湃新闻
2026-07-23 21:46:28
谢贤也没想到,自己离开还不到一周,两个孙子竟成了谢霆锋的退路

谢贤也没想到,自己离开还不到一周,两个孙子竟成了谢霆锋的退路

乡野小珥
2026-07-22 17:34:12
菲律宾把这张照片放出来的时候,就没考虑他们国防部长的面子吗?

菲律宾把这张照片放出来的时候,就没考虑他们国防部长的面子吗?

阿龙聊军事
2026-07-23 10:17:19
中方要求菲方24小时内拖走坐滩舰,马科斯召见中国大使

中方要求菲方24小时内拖走坐滩舰,马科斯召见中国大使

用冷眼洞悉世界
2026-07-23 16:58:18
演员寇占文被法院悬赏,曾出演《春光灿烂猪八戒》《镖人》

演员寇占文被法院悬赏,曾出演《春光灿烂猪八戒》《镖人》

韩小娱
2026-07-23 15:30:22
关注 | 多地机关单位宣布:“处长”改“科长”、“科长”改“股长”

关注 | 多地机关单位宣布:“处长”改“科长”、“科长”改“股长”

天津广播
2026-07-23 09:53:39
税收4亿,工资26亿:财政没钱,为什么编内待遇不能动?

税收4亿,工资26亿:财政没钱,为什么编内待遇不能动?

混沌录
2026-07-23 17:11:06
热议!滔搏回应暴力打折甩卖耐克库存,造成巨大负面影响

热议!滔搏回应暴力打折甩卖耐克库存,造成巨大负面影响

西昆仑Bruce
2026-07-23 18:23:22
2026-07-24 03:19:00
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12314文章数 117145关注度
往期回顾 全部

科技要闻

中国数学家王虹、邓煜获菲尔兹奖

头条要闻

女副部王峻被处理:大搞权钱交易 泄露工作秘密

头条要闻

女副部王峻被处理:大搞权钱交易 泄露工作秘密

体育要闻

勇士24岁的MVP,也是个勒布朗?

娱乐要闻

梁朝伟汤唯19年后境遇反转

财经要闻

梁文锋当不成赛博圣人

汽车要闻

满配华为乾崑六件套 东风奕派M8限时权益价16.58万起

态度原创

房产
时尚
艺术
本地
家居

房产要闻

狂抢111轮,溢价39%,楼面价刺破9500!海口土拍杀疯了!

我花40万追的老公,被公司亲手毁了

艺术要闻

战斗民族宅男集体失眠!扎伊采娃镜头下这组慵懒私房照,尺度不大,后劲极大!

本地新闻

跟着影视去旅行:西游篇

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版