网易首页 > 网易号 > 正文 申请入驻

以判别式监督学习强化推理LLM,解决难度偏差和熵崩塌难题

0
分享至

作者介绍:德州农工大学博士生李港,专注于设计和应用高效算法到大规模机器学习和人工智能任务,包括增强大型基础模型的后训练算法、对抗性鲁棒学习算法和分布鲁棒性学习算法。曾发表数篇论文在 NeurIPS、ICML、KDD 等顶会, 并作为主要贡献者之一发布了针对不平衡分类任务的知名软件包 LibAUC。

DeepSeek-R1 的成功吸引了人们对群体相对策略优化(GRPO)作为大型推理模型(LRM)强化学习方法的广泛关注。

在本文中,作者分析了二元奖励(binary reward)设置下的 GRPO 优化目标,发现了由其群体相对优势函数引起的问题难度偏差的固有局限性,并且揭示了 GRPO 与传统判别式监督学习方法之间的联系。

基于这些分析发现,作者提出了一个新颖的判别式约束优化(DisCO)框架来强化大型推理模型。该框架基于判别式学习的基本原则:增加正确答案的得分,同时减少错误答案的得分。

与 GRPO 及其变体相比,DisCO 具有以下优势:

  1. 它通过采用判别式优化目标完全消除了难度偏差
  2. 通过使用非裁剪评分函数和约束优化方法,解决了 GRPO 及其变体的熵不稳定性,得到了长期稳定的训练动态;
  3. 它允许结合先进的判别式学习技术来解决数据不平衡问题,例如在训练过程中一些问题的错误答案远远多于正确答案。

在增强大型模型的数学推理能力方面的实验表明,DisCO 大幅优于 GRPO 及其改进版本(如 DAPO),在 1.5B 模型的六个基准任务中,平均增益比 GRPO 高 7%,比 DAPO 高 6%。值得注意的是,最大响应长度(max response length)为8k 的 DisCO甚至优于最大响应长度为 32k 的 GRPO。

论文以「5,5,5,5」的高分被 NeurIPS 2025 接收。

  • 论文标题:DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization
  • 论文地址:https://arxiv.org/abs/2505.12366
  • 开源模型地址:https://huggingface.co/collections/ganglii/disco-681b705decb9979e65614d65
  • GitHub 地址:https://github.com/Optimization-AI/DisCO

GRPO 的难度偏差问题分析

GRPO 的核心思想在于对输入问题 q 生成多个输出,并定义群体相对优势函数。当采用期望形式而非经验平均时,其优化目标为:

其中:

从上面的变式分析中,作者有两个重要发现:

1. 与判别式监督学习的联系

2. 难度偏差(Difficulty Bias)

提出方法:判别式强化学习

1. 判别式目标函数(类似 AUC 优化)

基于上述与 AUC 最大化联系的分析发现,作者直接从判别式学习的原则重新设计了新的判别式强化学习框架:

为了避免其他研究发现的由裁剪操作引起的熵崩塌现象,作者设计选择非裁剪评分函数, 例如

2. 基于 DRO 的判别式目标函数(类似局部 AUC 优化)

基于判别式学习原则设计目标函数的一个优点是能够利用文献中先进监督学习技术来改进训练。推理模型的强化学习微调的一个关键挑战就是稀疏奖励,这导致答案生成的不平衡。具体来说,对于一些问题,错误答案的输出的数量可能大大超过正确答案的数量,这反映了一个经典的数据不平衡问题。这个问题在判别式学习领域中得到了广泛的研究。

为了解决这个问题,作者利用局部 AUC 优化设计了分布鲁棒性优化(DRO)目标:

3. 约束优化(稳定训练)

为了稳定训练,作者借鉴 TRPO 中的信任域思想,加入 KL 散度约束,形成以下优化问题:

不同于 TRPO 的二阶优化方法,作者采用近期发展的一种非凸不等式约束优化策略,将约束替换为平滑的方形铰链惩罚项 (squred hinge penalty):

实验结果与分析

测试效果对比

作者采用平均 16 次输出的 Pass@1 作为评价指标,在六个数学基准数据集上评估了 DisCO 和其他基线方法。

从下表观察到,作者提出的 DisCO 方法始终显著优于其他基线方法。值得注意的是,训练和推理长度均为 8k 的 DisCO (log-L)比 GRPO 平均提高了 7%,超过了以最大 24k 长度训练并以 32k 长度评估的 DeepScaleR-1.5B-Preview。在 7B 模型实验中,DisCO 也大幅优于所有基线方法,比 GRPO 平均提高了 3.5%

在上面这张表格中,作者展示了多种强化学习方法在 1.5B 模型上的效果对比。作者也加入了 OpenAI 的 o1-preview 模型作为参考基线。 表中的 MRL(Max Response Length)表示训练或测试时使用的最大响应长度,限制模型能生成多长的推理结果。 其中用阴影标注的模型,是其他团队所训练的成果,相应的指标也来自他们的原始论文或 DeepScalaR 项目。除了这些以外,其余结果要么来自现有模型的直接评估,要么是基于不同方法训练后得到的结果。 值得注意的是,表格下半部分的所有方法,都是基于相同的数据集(DeepScaleR),对 DeepSeek-R1-Distill-Qwen-1.5B 模型进行微调的结果。其中,DS 是 DeepSeek-R1 的缩写,DSR 是 DeepScalaR 的缩写。

训练动态对比

随着大规模强化学习训练成为改进推理模型的核心技术,学习算法的稳定性至关重要,因为学习稳定性决定了学习算法是否适用于大规模训练。作者从训练奖励和生成熵的角度比较了不同方法的训练动态。

从下图对 1.5B 和 7B 模型进行微调的实验中,我们可以看到,由于 GRPO、GRPO-ER、Dr. GRPO 的熵崩塌和 DAPO 的熵过度增长,它们都只能获得早熟的确定性策略或高度随机的策略,所有基线都出现了过早饱和。使用 KL 散度正则化的 TRPA 在后面的步骤中也观察到不稳定的生成熵。

相比之下,作者提出的 DisCO 使用两种非裁剪评分函数的方法最为稳定,训练奖励不断增加,生成熵保持相对稳定。

上图展示不同方法在训练过程中的动态表现:左边两张图展示的是在训练 1.5B 模型时的训练情况,右边两张图则对应于训练 7B 模型。图 (a) 和 (c) 展示了训练奖励随训练步数的变化情况,奖励是对每一步中用于训练的问题所生成答案的平均得分。图 (b) 和 (d) 展示的是生成结果的熵值(反映输出的多样性)随训练步数的变化趋势。

消融实验

从下图中可以看到,作者提出的每个组件在 DisCO 的改进中都很重要,其中使用非裁剪评分函数是至关重要的。

总结

在这项工作中,作者提出了一种新的判别式约束优化框架用于强化大型推理模型,避免了难度偏差和熵崩塌问题。数学推理实验表明,与 GRPO 及其最近的变体相比,本文方法具有显著的优越性。

虽然这项工作主要关注的是二元奖励,但是对于非二元奖励,可以考虑利用监督学习中排序目标函数或者其他新颖的评分函数来进行设计。作者将应用判别式约束优化微调更大的模型或其他推理任务留作后续研究。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
美国要变天了?一个比特朗普更难缠的80后,已经掌握了共和党

美国要变天了?一个比特朗普更难缠的80后,已经掌握了共和党

萧嚉影视解说
2026-04-14 16:52:43
特朗普要求伊朗举白旗投降

特朗普要求伊朗举白旗投降

界面新闻
2026-08-17 20:23:57
邹市明和冉莹颖开的拳馆,前员工甩出账目明细:300万水晶灯来自表弟,800万装修进了表妹公司,450万安保费包给外甥,70万绿植钱归亲哥

邹市明和冉莹颖开的拳馆,前员工甩出账目明细:300万水晶灯来自表弟,800万装修进了表妹公司,450万安保费包给外甥,70万绿植钱归亲哥

背包旅行
2026-07-31 11:39:46
短评:夯实社保!

短评:夯实社保!

财经飞说不可
2026-08-18 16:16:11
特朗普女婿库什纳与内塔尼亚胡会谈约4小时,库什纳称,“我们可能最快在30天内就能看到进展,希望届时能开始清除部分武器”

特朗普女婿库什纳与内塔尼亚胡会谈约4小时,库什纳称,“我们可能最快在30天内就能看到进展,希望届时能开始清除部分武器”

政知新媒体
2026-08-18 08:18:04
江苏退休注意!2026养老金别再被网传消息忽悠

江苏退休注意!2026养老金别再被网传消息忽悠

白浅娱乐聊
2026-08-18 13:53:27
西方战略专家曾直言:从国力角度来说,中国领土恐怕最终会全收回

西方战略专家曾直言:从国力角度来说,中国领土恐怕最终会全收回

赶山的姑娘
2026-08-14 18:35:25
U18男篮大胜伊朗直通八强!净胜38分+3连胜,冲击四强问题不大

U18男篮大胜伊朗直通八强!净胜38分+3连胜,冲击四强问题不大

乒烧泳球
2026-08-18 14:53:19
正式签约!CBA广东男篮签约中锋,19岁240斤,苏伟二代,年薪30万

正式签约!CBA广东男篮签约中锋,19岁240斤,苏伟二代,年薪30万

林子说事
2026-08-18 01:17:05
金螳螂连收5个涨停板

金螳螂连收5个涨停板

证券时报
2026-08-18 10:18:06
刚夺冠仅1天,王曼昱宣布重大决定,王励勤最担心的事或要发生

刚夺冠仅1天,王曼昱宣布重大决定,王励勤最担心的事或要发生

用冷眼洞悉世界
2026-08-18 14:43:22
受权发布|中华人民共和国国务院令  第844号

受权发布|中华人民共和国国务院令  第844号

新华社
2026-08-18 17:01:33
伊朗革命卫队军官:以色列太弱,无法与伊朗开战。

伊朗革命卫队军官:以色列太弱,无法与伊朗开战。

乐天WMQ
2026-08-17 20:37:59
暴雨后,有市民在兴隆湖逮鱼;医生提醒:当心得脚气和烂脚

暴雨后,有市民在兴隆湖逮鱼;医生提醒:当心得脚气和烂脚

掌上金牛
2026-08-18 11:52:03
电视剧收视率排行榜,《花开锦绣》跌出前三,第一收视高达3.048%

电视剧收视率排行榜,《花开锦绣》跌出前三,第一收视高达3.048%

周老师讲电影
2026-08-18 10:35:14
一年内打网约车逃单800次,骗取平台车费30余万元,乘客被判了4年!

一年内打网约车逃单800次,骗取平台车费30余万元,乘客被判了4年!

网约车焦点
2026-08-18 11:05:49
央视怒批!戏子误国,这3位明星恶贯满盈,没有一个人值得同情!

央视怒批!戏子误国,这3位明星恶贯满盈,没有一个人值得同情!

旧史新谭
2026-08-17 16:07:02
“新型出轨方式”正悄然兴起,不私会不开房,却正在毁掉千万家庭

“新型出轨方式”正悄然兴起,不私会不开房,却正在毁掉千万家庭

流史岁月
2026-08-10 10:46:45
5分钟,看完《牛来》全剧情

5分钟,看完《牛来》全剧情

果壳
2026-08-17 12:32:44
女孩被外籍男教师搂在怀中,一对一上口语课,母亲拍下视频发到网上感慨:满满的松弛感!网友看了视频提醒母亲,这种举动恐怕不合适

女孩被外籍男教师搂在怀中,一对一上口语课,母亲拍下视频发到网上感慨:满满的松弛感!网友看了视频提醒母亲,这种举动恐怕不合适

美芽
2026-08-18 06:05:35
2026-08-18 18:28:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13788文章数 142720关注度
往期回顾 全部

科技要闻

特斯拉Cybercab有望本月投放运营

头条要闻

山西前首富张新明涉黑被公诉 "百亿矿权之争"震动全国

头条要闻

山西前首富张新明涉黑被公诉 "百亿矿权之争"震动全国

体育要闻

中国男篮,一直被质疑,永远被期待

娱乐要闻

蓝盈莹官宣新恋情

财经要闻

许家印,崩了东北富二代42个亿

汽车要闻

一条视频读懂华为乾崑WEWA 2.0架构核心:WA世界行为模型

态度原创

健康
艺术
家居
亲子
教育

女孩更易侧弯?几类孩子风险偏高

艺术要闻

这才是明代最美书法!启功:500年才出一件

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

孩子换牙期多啃苹果, 真的能让脸型变好吗?

教育要闻

环形跑道追及问题,图解清晰易懂!

无障碍浏览 进入关怀版