网易首页 > 网易号 > 正文 申请入驻

SimKO:缓解RLVR训练中的概率过度集中,优化pass@K性能

0
分享至

作者彭若天是西湖大学和浙江大学联培博士生,任毅是不列颠哥伦比亚大学博士,郁昼亮是香港中文大学博士生,刘威杨是香港中文大学计算机系助理教授,温研东是西湖大学人工智能系助理教授

随着 Deepseek-R1,Kimi1.5 等模型展示了强化学习在提升大型语言模型复杂推理能力上的巨大潜力,使用可验证强化学习(RLVR)在数学、逻辑与编程等领域进行训练提升模型性能受到了广泛关注。

然而,尽管现有 RLVR 方法在提升模型的 pass@1 性能(单次尝试正确的概率)方面取得了显著成果,但其在 pass@K(K 次尝试中至少一次正确的概率,K>1)上的性能相比基础模型却下降了。

这一现象表明,虽然模型在「利用」(Exploitation)单一正确路径的能力有所增强,但牺牲了对多样化正确解的「探索」(Exploration)能力。

针对这一问题,研究团队从「模型预测下一个词的概率分布」这一新视角出发,深入研究了「探索」能力下降的内在机制。大量实验发现,经过现有 RLVR 算法训练后的模型,多数存在概率集中于单一推理路径的问题。

受该现象启发,研究团队提出一种简洁且高效的算法 ——SimKO (Simple Pass@K Optimization),显著优化了 pass@K(K=1 及 K>1)性能。

图 1

  • 论文地址:https://arxiv.org/abs/2510.14807
  • 项目主页:https://spherelab.ai/simko/
  • 代码仓库:https://github.com/CLR-Lab/SimKO

问题分析:导致 RLVR 探索能力下降的原因是什么?

当前主流的大语言模型强化学习算法(如 GRPO、DAPO 等)采用 RLVR 范式,其训练方法可以直观理解为:模型对每个问题生成多个答案,对正确答案给予奖励,对错误答案施加惩罚。在理想的探索状态下,模型能够在多个潜在正确推理路径之间分配相对均匀的概率质量,不应将概率过度集中于某一条正确路径上,如图 2 (a) 和 (b) 所示。

同时,团队认为当前的用熵(Entropy)作为指标衡量多样性存在局限:熵无法具体反映概率分布的形态。如图 2(c)所示,两个具有相同熵值的分布,一个可能包含多个峰值,而另一个则可能高度集中于一个峰值。

因此,熵无法精确描述模型在推理过程中对不同推理路径的真实探索程度。

图 2

因此,团队引入了一种新的分析指标,用于更加精细地观察训练过程中的学习动态:该指标通过测量模型在生成过程中,反映下一 token 后验概率分布的不同排名候选词(rank-k candidate)的平均对数概率(average log-probability),从而实现对概率分布演化动态的直接观测。

通过这一新指标,作者发现RLVR 训练机制存在一个系统性偏差(如图 3 所示):

它会持续强化 rank-1 候选词的概率,同时显著抑制其他较低排名(rank-k, k>1)的候选路径,即使那些路径同样是正确的。

这种机制导致了模型输出分布的「过度集中」。模型的概率质量过度汇聚于单一的推理路径,导致其丧失了生成多样化正确答案的能力。

更重要的是,进一步实验分析明确揭示了概率过度集中问题与 pass@K 性能的下降之间存在强相关性:当模型概率分布越集中于 rank-1 答案,而 rank-2 和 rank-3 的概率越低的时候,其 pass@K 指标也随之降低。

图 3

SimKO:一种非对称的梯度调节策略

图 4

为解决上述的概率过度集中问题,研究团队提出了 SimKO (Simple Pass@K Optimization)。其核心机制在于对探索 token 施加非对称的更新策略(如图 4 所示):即在正确的推理路径上实现概率平滑,而在错误的推理路径上施加精准惩罚。

(A) 关键节点的识别

SimKO 并非对所有 token 进行无差别调节。它首先识别推理路径中具有高熵的 token,这些 token 代表了模型面临多个高概率选项、可能产生不同推理方向的关键节点。因此 SimKO 更新策略只应用于这些关键节点。

(B) 正确路径:实施 top-K Label Smoothing

  • 传统方法 (GRPO):仅提升被采样到的单个正确 token的概率。由于推理路径是由模型自行采样的,因此采样到的的 token 是 rank-1 候选 token 的概率较高高,这是导致概率过度集中于 rank-1 的直接原因。这种机制容易使概率质量集中在单路径,从而抑制了对其他潜在正确路径的探索。
  • SimKO :对正确的 token 使用 top-K label smoothing 策略。当一个采样路径被验证为正确时,SimKO 将奖励均匀分配给路径上的关键节点处概率最高的 top-K 个候选 token。该策略防止概率分布集中在单一的正确路径上,从而在强化正确路径的同时,维持了模型的探索多样性。

(C) 错误路径:对 rank-1 token 精准惩罚

  • 传统方法 (GRPO):对所有被采样到的错误 token 施加统一强度的惩罚。 这种统一惩罚常导致「挤压效应」(Squeezing Effect)。即当一个非 rank-1 的错误候选 token 被惩罚时,这部分概率会被 rank-1 候选 token 吸收,从而提高 rank-1 token 的概率,这会让模型的概率分布更加集中。
  • SimKO :对错误的 token 进行非对称惩罚。当采样的错误 token恰好是 rank-1 候选时,施加显著更强的惩罚;而对其他(rank-k, k>1)错误候选则降低惩罚强度。这种策略缓解了惩罚非 rank-1 token 带来的概率集中问题,同时对 rank-1 token 实施更强的惩罚也防止模型陷入单一的错误推理模式。

实验分析:实现「探索」与「利用」的平衡

团队在多个数学推理基准(MATH500、AIME 2024/25、Minerva Math、OlympiadBench、AMC23)上对 Llama 和 Qwen 模型进行了系统性评估。如表 1 所示,SimKO 策略在显著提升 pass@K 性能的同时,成功保持(或略微提升)了 pass@1 准确率,证明其有效平衡了「探索」与「利用」。

表 1

为了验证 SimKO 是否有效缓解了概率分布过度集中问题,研究团队使用上述新提出的分析指标,追踪了模型使用不同 RLVR 算法训练过程中的学习动态(如图 5 所示):

  • GRPO:随着训练的进行,模型表现出严重的概率过度集中现象。rank-1 的概率迅速收敛至接近 1,而 rank-2 与 rank-3 的概率则降低至 10⁻⁸ 与 10⁻¹⁰以下。这表明,几乎所有的概率质量都集中到了 rank-1 token 上,导致模型训练后丧失了探索能力。
  • SimKO:相比之下,SimKO 展示出了有效的缓解概率集中效果。其 rank-1 的概率显著低于 GRPO,同时为 rank-2 与 rank-3 保留了更高的概率质量。这一结果有力地表明了 SimKO 通过缓解了概率过度集中问题,从而提升了模型的探索能力,进而提升 pass@K 性能。

图 5

SimKO 不仅在数学推理任务上表现优异,在逻辑推理任务中同样具有出卓越的泛化效果(见表 2):

  • Synlogic (分布内任务):SimKO 相比 GRPO 表现出更好的性能,pass@1 提升 31.6%,pass@128 提升 26.3%。相比之下,NSR 和 W-REINFORCE 在此任务上未能有效收敛(pass@1 仅 1.1% 和 0.8%)。
  • BBH (分布外任务):SimKO 在提升 pass@1(+16%)的同时,pass@128 依然有良好的性能(92%)表现。而对照组 GRPO(88.2%) 和 PSR (82.8%)则在 pass@128 相比基础模型出现了显著的性能衰减。

表 2

更多细节详见论文原文。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
紫牛头条|走遍全球233个国家!浙江诸暨男子花33年兑现年少全球旅行梦

紫牛头条|走遍全球233个国家!浙江诸暨男子花33年兑现年少全球旅行梦

扬子晚报
2026-09-01 09:48:09
赖清德,或将成为新中国历史上,首位任内遭变故的台湾地区领导人

赖清德,或将成为新中国历史上,首位任内遭变故的台湾地区领导人

共工之锚
2026-09-01 00:14:55
“我被撞就活该吗?”女子横穿马路被判全责,上海交警一句话硬核回答

“我被撞就活该吗?”女子横穿马路被判全责,上海交警一句话硬核回答

上观新闻
2026-09-01 17:17:38
马杜罗将在监狱自生自灭,拘押地曝光:牢房约6㎡,条件恶劣暴力频发,被称“人间地狱”;委代总统发声:合法总统只有一个副总统

马杜罗将在监狱自生自灭,拘押地曝光:牢房约6㎡,条件恶劣暴力频发,被称“人间地狱”;委代总统发声:合法总统只有一个副总统

极目新闻
2026-09-01 10:03:42
“没有手艺都是科技”,青岛一烤羊店招牌被六旬师傅装反,店主:主打纯手艺无科技,视频太火了,正在犹豫要不要改过来

“没有手艺都是科技”,青岛一烤羊店招牌被六旬师傅装反,店主:主打纯手艺无科技,视频太火了,正在犹豫要不要改过来

扬子晚报
2026-09-01 12:22:59
孙宇晨破防,全网实名批量投诉,他无法接受别人提孙割这个名字

孙宇晨破防,全网实名批量投诉,他无法接受别人提孙割这个名字

芊手若
2026-09-01 15:06:19
情侣连住酒店145天拒绝保洁打扫,离店后客房清出20袋垃圾,酒店:头回遇到,将深度消毒

情侣连住酒店145天拒绝保洁打扫,离店后客房清出20袋垃圾,酒店:头回遇到,将深度消毒

封面新闻
2026-09-01 11:49:07
22页出轨PDF疯传,内容相当劲爆!

22页出轨PDF疯传,内容相当劲爆!

车轱辘话V
2026-09-01 11:24:27
亨利·哈曼·阿达姆松(广东省大湾区集成电路与系统应用研究院首席科学家)突发疾病,去世

亨利·哈曼·阿达姆松(广东省大湾区集成电路与系统应用研究院首席科学家)突发疾病,去世

南方都市报
2026-09-01 13:20:03
孙宇晨向胡锡进开炮了

孙宇晨向胡锡进开炮了

凤眼论
2026-09-01 17:51:39
10月1日起,18到60岁都可能被征召,这部新法藏着什么信号

10月1日起,18到60岁都可能被征召,这部新法藏着什么信号

施涛说
2026-09-01 11:16:16
又关中国事?尼泊尔救灾为何被套上地缘博弈剧本?

又关中国事?尼泊尔救灾为何被套上地缘博弈剧本?

看看新闻Knews
2026-09-01 13:18:01
黑天鹅突袭!全球股市、黄金、白银,直线跳水!

黑天鹅突袭!全球股市、黄金、白银,直线跳水!

中国基金报
2026-09-01 18:10:52
后续来了!那个叫嚣“我就是违法,你去告啊”的HR,被00后一夜治服了

后续来了!那个叫嚣“我就是违法,你去告啊”的HR,被00后一夜治服了

小徐讲八卦
2026-09-01 08:18:51
尼泊尔泥石流已致1010人死亡 4599人失联

尼泊尔泥石流已致1010人死亡 4599人失联

新华社
2026-09-01 15:20:20
科大讯飞出轨女主更多照片曝光:她长得娇小可爱,丈夫应该再给她一次机会

科大讯飞出轨女主更多照片曝光:她长得娇小可爱,丈夫应该再给她一次机会

汉史趣闻
2026-09-01 13:47:29
今晚赛事:9月1日晚19点30,中央电视台CCTV5、CCTV5+直播节目表

今晚赛事:9月1日晚19点30,中央电视台CCTV5、CCTV5+直播节目表

江启
2026-09-01 14:45:27
莫迪已经做好准备,一旦特朗普对中国出手,印度将迎来泼天富贵?

莫迪已经做好准备,一旦特朗普对中国出手,印度将迎来泼天富贵?

小言爱历史
2026-09-01 13:31:24
扔球砸人球迷身份曝光!16岁高中生+赞助商儿子 本想砸裁判或对手

扔球砸人球迷身份曝光!16岁高中生+赞助商儿子 本想砸裁判或对手

念洲
2026-09-01 15:34:42
任贤齐新车刚上路就被剐蹭,两车门变形心疼不已 才帅了没几天

任贤齐新车刚上路就被剐蹭,两车门变形心疼不已 才帅了没几天

小椰的奶奶
2026-08-30 14:18:29
2026-09-01 21:07:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13898文章数 142728关注度
往期回顾 全部

科技要闻

抖音突发推荐算法大面积错乱!

头条要闻

女子横穿马路被判全责 反问交警"我被撞了就活该了吗"

头条要闻

女子横穿马路被判全责 反问交警"我被撞了就活该了吗"

体育要闻

大爹杨瀚森,让中国男篮有了容错空间

娱乐要闻

孙宇晨破防,他无法接受孙割这个名字

财经要闻

库克卸任,苹果下一个增长点在哪?

汽车要闻

山城试驾启源Q06 不光是智驾好用还有700km的续航

态度原创

数码
教育
艺术
本地
军事航空

数码要闻

服役7年终成绝唱!苹果将三款Intel MacBook打入“冷宫”:官方不再提供维修

教育要闻

【预告】9月4日|南方教研大讲堂第193场:以体塑形 守护健康——中小学生脊柱弯曲异常预防的体育教学策略

艺术要闻

273米!深圳大家金融中心全面运营,KPF设计

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

军事要闻

特朗普:不会对伊朗用核武器

无障碍浏览 进入关怀版