网易首页 > 网易号 > 正文 申请入驻

GUPO: GRPO后训练中46.5%组梯度互相冲突

0
分享至

来源:市场资讯

(来源:机器学习算法那些事)

DEEP ANALYSIS

当近半数组梯度在互相打架

GUPO 给 GRPO 补上「可靠性」这一课

一项实证研究给出量化证据:GRPO 训练中 46.5% 的组梯度方向互相冲突,而冲突正是「越练越差」的信号

撰文 · 2026年8月24日 | 阅读约10分钟

自 DeepSeek-R1 把强化学习带进推理模型的后训练以来,GRPO(Group Relative Policy Optimization)几乎成了这一赛道的默认选项:它用组内相对优势做标准化,省去了 PPO 里笨重的 critic 模型,训练开销大幅下降。从开源复现到商业后训练管线,GRPO 已经渗透到几乎所有推理模型的训练配方里。

但一个被大多数人忽略的细节,正在悄悄侵蚀它的上限。2026 年 8 月 18 日,Peizheng Guo 等 7 位研究者提交的论文《GUPO: Gradient Uncertainty-aware Policy Optimization for Post-Training Large Language Models》给出了一组扎眼的数字:在同一 mini-batch 内,实测 563 对组梯度中有 262 对(46.5%)余弦相似度为负——也就是说,将近一半的时候,不同查询想让模型更新的方向是相反的。而标准 GRPO 的做法,是把这些互相打架的梯度直接平均。


更关键的是,论文证明这种冲突并非无害噪声:高冲突 mini-batch 的验证 ΔNLL 中位数显著更低,甚至出现「负更新」——模型不是没学到,而是越练越差。GUPO 的解法也很克制:不动奖励、不动采样,只在聚合这一层把「确定性平均」换成「不确定性加权」。

论文速览

论文

GUPO: Gradient Uncertainty-aware Policy Optimization for Post-Training Large Language Models(arXiv:2608.17411,2026-08-18)

作者

Peizheng Guo、Jianqi Zhang、Xingyu Zhang、Yun Fan、Jiahuan Zhou、Changwen Zheng、Wenwen Qiang(共 7 人)

核心发现

563 对组梯度中 46.5% 余弦相似度为负;高冲突 mini-batch 对应更差甚至为负的验证更新

方法

贝叶斯建模组梯度分布 → Dirichlet 证据推导不确定性 → 不确定性感知加权聚合

实验规模

3 款模型(1.5B/1.5B/7B)× 6 个数学推理基准,全面超越 6 个近期基线

一句话

GRPO 把所有组梯度一视同仁地平均,GUPO 教它先问一句「这条梯度可信吗」

一、GRPO 的数学便利,埋下了一个统计隐患

要理解这次发现为何重要,得先回到 GRPO 的核心机制。在 PPO 时代,策略梯度需要一个 critic 网络来估计每个状态的价值基线;而 GRPO 的做法是:对同一个查询采样一组回答,用组内奖励的相对排名做标准化——高于组均值的回答被强化,低于组均值的被抑制。这个设计极其优雅,critic 没了,内存省了,实现简单了,也因此成为 DeepSeek-R1 之后推理后训练的事实标准。

但便利的另一面是一个隐含假设:同一 mini-batch 里,不同查询各自诱导出的组梯度(group gradient)大致指向同一个方向。只有这样,「直接平均」才是合理的聚合方式。标准 GRPO 把每条组梯度都视为确定性的贡献,权重一律相同——它从不追问一个问题:这条梯度,可靠吗?

直觉上这个假设就值得怀疑。mini-batch 里的查询难度各异:有的题模型几乎全对,组内奖励无区分度;有的题全错,梯度信息混乱;有的题梯度干净清晰。把「噪声很大的梯度」和「信号清晰的梯度」等权平均,信号自然被稀释。GUPO 团队做的事,是把这个直觉变成可测量的实证。

二、46.5%:一次对训练动态的「体检」

研究者在 GRPO 后训练过程中,对 mini-batch 内所有组梯度两两计算余弦相似度,共得到 563 对组梯度。结果令人不安:其中 262 对(46.5%)余弦相似度为负。将近一半的梯度对,指向的是相反的更新方向。

组梯度对总数

563

同一 mini-batch 内两两配对

余弦相似度为负

46.5%

262 对梯度方向互相冲突

高冲突 mini-batch 的验证 ΔNLL 中位数更低,甚至出现负值 —— 冲突不是噪声,是退化的前兆

冲突本身还不是最糟的。真正致命的关联是:研究者发现组梯度冲突程度与策略更新质量负相关。高冲突的 mini-batch,其验证集上的 ΔNLL(负对数似然变化)中位数明显更低,部分甚至落入负值区间——意味着经过这一步更新,模型在验证集上反而变差了。训练曲线上那些无法解释的抖动和回退,此刻有了具体的统计学解释。

值得强调的是,这类问题在以往文献中大多停留在现象观察层面,GUPO 的贡献在于给出了一条清晰的因果链条:冲突的梯度 → 等权平均互相抵消甚至反转 → 更新方向失真 → 验证性能下降。这为「为什么 GRPO 有时训练不稳定」提供了第一个量化证据链。

三、GUPO 的三步:从确定向量到不确定分布

GUPO 的核心思想可以用一句话概括:不再把组梯度当作一个确定的向量,而是当作一个带不确定性的随机变量,然后让「更可靠的梯度」在聚合时说更大的话。整个方法分三步实现,全部发生在聚合层,不触碰 GRPO 的奖励计算和采样逻辑。

方法三步拆解

01贝叶斯后验建模 —— 直接对 LLM 全部参数做后验估计不现实,GUPO 聚焦策略模型可训练的末层参数 Φ,用高斯近似建立后验 q(Φ|D)=N(Φ₀, Ĥ⁻¹),其中 Ĥ 用经验 Fisher 信息的对角近似得到

02组梯度分布估计 —— 从参数后验中蒙特卡洛采样 M 个参数样本,分别计算组梯度,得到每条组梯度的均值 μ 和逐元素方差 σ²,即梯度的概率分布

03Dirichlet 证据与加权聚合 —— 把梯度精度 λ=1/σ² 映射为证据 e=λˢ,借鉴主观逻辑建立 Dirichlet 浓度参数,推导出组级不确定性 u;聚合权重 ω=(1−u)/Σ(1−u),让低不确定性的组梯度获得更大贡献

第三步里有一个值得玩味的工程细节。GUPO 没有激进地用新权重完全替换原始平均,而是做了一个低侵略性调和:最终权重为 ω̃=(1−η)/B+ηω,其中 η 取 0.1。也就是说,90% 的成分仍是均匀平均,只有 10% 的幅度按可靠性重新分配。这保留了 GRPO 原有的聚合结构,把方法风险压到最低——这种克制,是论文实验能全面稳定涨点的隐性原因之一。

关键洞察

诊断先于治疗 GUPO 的价值排序值得注意:46.5% 冲突率的实证测量本身,比修复方法更重要——它第一次让「GRPO 训练不稳定」从经验感受变成了可监测的指标。

修复发生在聚合层 不改奖励、不改采样、不改网络结构,只在梯度合并这一步引入可靠性加权——这意味着它可以近乎零成本地叠加到任何现有 GRPO 管线上。

四、实验:三个规模、六个基准的全面领先

团队在三款基础模型上验证:DeepScaleR-1.5B-Preview、DeepSeek-R1-Distill-Qwen-1.5B 和 DeepSeek-R1-Distill-Qwen-7B,覆盖 GSM8K、MATH500、AIME 等六个数学推理基准。结果是一边倒的稳定提升,平均 Pass@1 增益在 +2.7 到 +3.0 之间,且规模越大基线越强,增益依然保持。

基础模型

GRPO 平均 Pass@1

GUPO 平均 Pass@1

DeepScaleR-1.5B-Preview60.763.4(+2.7)R1-Distill-Qwen-1.5B52.455.4(+3.0)R1-Distill-Qwen-7B69.671.4(+1.8)

单项基准上,DeepScaleR-1.5B 在 AIME 2024 上提升 +4.2,是最大的单项增益。横向对比方面,GUPO 全面压过近期一批 GRPO 改进工作,包括 Length Penalty、ReST-MCTS、GVPO、Dr.GRPO、GCPO 和 MRT。消融研究进一步确认了两个超参数的鲁棒性:证据敏感度 s 与调和系数 η 在合理区间内波动不大,且性能增益主要来自高冲突 mini-batch——这反向印证了「冲突是问题根源」的诊断。

五、启示与边界:不是银弹,是一面镜子

对于做后训练的团队,这篇论文的价值有两个层次。第一层是直接的:一个低侵入、可叠加的聚合层改进,几乎可以无损并入现有 GRPO 管线换取稳定涨幅。第二层更重要:论文提供了两个此前缺席的观测指标——组梯度冲突率与验证 ΔNLL。把这两个数和 benchmark 分数一起放进训练监控面板,「训练在不在健康区间」第一次有了量化答案。

放在更大的图景里,GUPO 与近期一系列工作指向同一个判断:GRPO 这一代算法的下一个优化空间,不在更大的奖励模型或更多的采样,而在训练信号本身的质量工程。梯度冲突、优势反转、信用误分配——这些统计层面的病灶,正在成为后训练研究的新前线。对主攻小模型后训练的团队而言,这类「训练动力学体检 + 精准微创修复」的方法论,性价比可能远高于堆数据。

需要留意的局限

01计算开销 —— 每个组需要采样 M 个参数样本估计梯度分布,末层聚焦虽已压缩成本,仍比标准 GRPO 多一截前向计算

02基准范围 —— 实验限于数学推理任务,在代码、通用对话、事实性与安全约束等后训练目标上的泛化性尚待验证

03建模假设依赖 —— 对角 Fisher 近似与 Dirichlet 映射的假设在极端梯度分布下的稳健性,论文未充分讨论

04架构泛化 —— 三个模型均为 Qwen 系或其衍生,MoE 架构与其他模型家族上的表现仍是空白

结语:后训练的下一站,是学会「不信」

GUPO 讲的其实是一个朴素的故事:当一半的信号在互相矛盾时,无条件相信每一个信号的平均值,本身就是一种偏见。它教给 GRPO 的第一课不是更聪明的奖励,而是最基本的怀疑精神——先问可信度,再做平均。

对行业而言,这篇论文大概率会被记住的不是 +2.7 的涨幅,而是那个 46.5%。它把「GRPO 训练不稳定」从一个工程师之间的抱怨,变成了一个可测量、可监控、可修复的具体问题。当一个领域开始给训练过程做「体检指标」时,说明它正在从炼丹术走向工程学——而这,正是后训练走向成熟的必经之路。

核心判断

短期 冲突率与验证 ΔNLL 应成为 GRPO 训练监控的标准面板指标,与 benchmark 分数并列汇报。

中期 聚合层加权这类「零侵入」改进,是小模型后训练团队性价比最高的一类增量优化。

长期 训练信号质量工程(梯度冲突、优势反转、信用分配)正在成为后训练研究的新前线——奖励设计之后,这里是下一个价值洼地。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
突发!大牛股,被证监会立案调查,曾涉跨界收购7连涨停

突发!大牛股,被证监会立案调查,曾涉跨界收购7连涨停

数据宝
2026-09-05 08:18:43
突然不打了!三冠王+三MVP!这也太可惜了......

突然不打了!三冠王+三MVP!这也太可惜了......

体育新角度
2026-09-05 11:34:16
给乌克兰“扣帽子”之后,美众议院宣布不会就对俄制裁法案投票

给乌克兰“扣帽子”之后,美众议院宣布不会就对俄制裁法案投票

山河路口
2026-09-04 16:51:40
太遗憾!李月汝护照丢失原因曝光,这就是被吹捧的美国公共系统?

太遗憾!李月汝护照丢失原因曝光,这就是被吹捧的美国公共系统?

风月得自难寻
2026-09-05 04:34:07
断交伊朗只是开始!下一个可能是台湾?秘鲁新总统给中国敲响警钟

断交伊朗只是开始!下一个可能是台湾?秘鲁新总统给中国敲响警钟

李健政观察
2026-09-04 13:26:21
华为“被讨厌”不是没道理,Mate90 ProMax这一堆猛料砸下来,苹果怎么比?

华为“被讨厌”不是没道理,Mate90 ProMax这一堆猛料砸下来,苹果怎么比?

大卫聊科技
2026-09-04 13:47:51
伊朗导弹没打中F-35,却打中了美军最大命门!18名美军在中东丧生

伊朗导弹没打中F-35,却打中了美军最大命门!18名美军在中东丧生

杰丝聊古今
2026-09-04 20:24:12
为什么现在社会上挤满了平庸到令人发指的高学历?网友说:985学历在如今就是坨屎!

为什么现在社会上挤满了平庸到令人发指的高学历?网友说:985学历在如今就是坨屎!

黯泉
2026-09-05 11:21:41
央国企最大的问题:戏子当道!

央国企最大的问题:戏子当道!

黯泉
2026-04-18 09:20:48
俄方提议:将上合升级为“欧盟”,融为一体,避免中印那样的分歧

俄方提议:将上合升级为“欧盟”,融为一体,避免中印那样的分歧

真的好爱你
2026-09-04 09:32:04
事情闹大了!伊朗全域开火,美军仓皇溃败,特朗普换将无力翻盘?

事情闹大了!伊朗全域开火,美军仓皇溃败,特朗普换将无力翻盘?

浯江孤舟
2026-09-03 08:37:51
重伤老人换四家医院都不敢收?家属:没有医院愿意担责!到底是医院冷漠,还是环境逼不得已?

重伤老人换四家医院都不敢收?家属:没有医院愿意担责!到底是医院冷漠,还是环境逼不得已?

医脉圈
2026-09-05 12:14:44
45岁男子与女友合租一年吃30次他达拉非,一年后房颤,医生:无知

45岁男子与女友合租一年吃30次他达拉非,一年后房颤,医生:无知

垚垚分享健康
2026-09-04 11:20:15
我闺蜜32岁了,前天被父母逼着嫁人了,今天她却兴奋的像一小姑娘

我闺蜜32岁了,前天被父母逼着嫁人了,今天她却兴奋的像一小姑娘

千秋文化
2026-09-03 19:38:12
超市卖米面油的表姐说了句大实话:包装再花哨也别信,翻到袋子背面认准这几个数

超市卖米面油的表姐说了句大实话:包装再花哨也别信,翻到袋子背面认准这几个数

奇葩游戏酱
2026-08-30 04:57:19
曹德旺当年反对女儿嫁给厦大高材生,理由只有一句:他太优秀了!14年后,这个女婿拿到的不是聘书,而是福耀的一份重任

曹德旺当年反对女儿嫁给厦大高材生,理由只有一句:他太优秀了!14年后,这个女婿拿到的不是聘书,而是福耀的一份重任

背包旅行
2026-09-03 15:48:21
四川绵竹上空出现大量鸟群密集盘旋,官方明确表示该现象为季节性常态,与地震无任何直接关联,呼吁公众不必恐慌

四川绵竹上空出现大量鸟群密集盘旋,官方明确表示该现象为季节性常态,与地震无任何直接关联,呼吁公众不必恐慌

潇湘晨报
2026-09-04 17:03:22
不要说食肉糜的事了,请向体育总局学习!

不要说食肉糜的事了,请向体育总局学习!

红色少女主播
2026-09-05 00:28:58
奖金195万元!26岁吴易昺0-3输世界第3 阿卡狂赞:他打得不可思议

奖金195万元!26岁吴易昺0-3输世界第3 阿卡狂赞:他打得不可思议

风过乡
2026-09-05 07:54:15
印度砸30亿美元要拆中国通信设备,西班牙替全世界试了个错

印度砸30亿美元要拆中国通信设备,西班牙替全世界试了个错

王新喜
2026-09-04 11:22:35
2026-09-05 12:51:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4666688文章数 9470关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

牛弹琴:164国赞成只有美国1票反对 世界地图要变了

头条要闻

牛弹琴:164国赞成只有美国1票反对 世界地图要变了

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

她曾被名导抛弃,凭《生逢其时》翻红

财经要闻

姚洋:刺激消费要守住两个“大西瓜”

汽车要闻

全新第四代博越Li‑HEV系列 怎么开都省

态度原创

时尚
艺术
旅游
数码
公开课

杨紫:自渡成舟

艺术要闻

2026潮涌宁波—第六届综合材料绘画展 入选作品选(二)

旅游要闻

无锡这个大网红!回来了!

数码要闻

七彩虹灵创K16游戏本新增128G + 4T版本,39999元

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版