网易首页 > 网易号 > 正文 申请入驻

Pass@k 15/15 组全胜!清华&腾讯发布 LPO,补齐 DeepSeek-R1 推理多样性的「短板」 | GAIR Paper 122

0
分享至


不只是答对,LPO 如何为 DeepSeek 后的推理模型装上“逻辑刹车”?

作者丨Leon Peng

编辑丨岑峰

DeepSeek-R1 之后,基于可验证奖励的强化学习(RLVR)几乎成了推理模型后训练绕不开的话题。

它的基本思路并不复杂:面对同一道数学题、代码题或逻辑题,模型一次采样多条回答,再由 verifier 判断哪些答对了,最后用 GRPO 一类方法提高高奖励回答的概率。

但这里有一个很容易被忽略的问题:如果一道题本来就有多种正确解法,训练到底应该把模型推向“最像标准答案的一条路径”,还是尽量保留多条都能走通的路径?

这并不是一个只影响论文指标的问题。

当推理模型进入 Agent、代码生成、搜索与复杂决策场景后,我们越来越希望它在第一次尝试失败时还能换一条路,而不是反复复现同一种推理模板。换句话说,除了“答对一次”,模型能不能保留足够多的有效解法,也开始变得重要。

清华大学自动化系与腾讯混元的研究者提出Listwise Policy Optimization(LPO),正是从这个角度重新审视 GRPO 等 group-based RLVR 方法。

他们发现,GRPO、Dr.GRPO、MaxRL 等方法表面上是在设计不同的 advantage normalization,背后其实都在做同一件事:给一组候选回答重新分配概率,只不过过去这个目标分布一直藏在策略梯度里。

LPO 则把它直接“摊在桌面上”:先明确希望这组回答最终形成怎样的概率分布,再选择合适的方式让模型向这个目标靠近。

实验中,在保持目标温度一致的严格配对比较下:

与 在 上都取得 13/15 组胜出; 在 上实现 15/15 组全部胜出;

  • 前向 KL 版本又在 13/15 组 对比中超过反向 KL 版本;

  • LPO 同时保持了更高的响应熵,以及更低、更平滑的梯度范数。


如果只看“又一个 RL loss”,这些结果很容易被低估。更值得讨论的是:LPO 把“追求高奖励”和“保留多少种有效解法”放进了一个可以显式控制的框架里。


论文标题:Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex

论文作者:Yun Qu、Qi Wang、Yixiu Mao、Heming Zou、Yuhang Jiang、Yingyue Li、Wutong Xu、Lizhou Cai、Weijie Liu、Clive Bai、Kai Yang、Yangkun Chen、Saiyong Yang、Xiangyang Ji

主要作者:曲云,清华大学自动化系学生,研究方向包括强化学习与大模型效率优化,曾担任腾讯青云计划实习生,以一作/共一在Nat. Commun.、ICML、NIPS等发表十余篇文章。

机构:清华大学自动化系季向阳教授团队、腾讯混元(LLM Department, Tencent)

论文地址:https://arxiv.org/abs/2605.06139

01


把 LLM Response Simplex

想成“一桌答案,100 张筹码”

论文里最容易让非数学背景读者卡住的概念,是LLM Response Simplex

其实可以把它理解得很直观。

假设模型面对同一个 prompt,一次生成了 条回答。现在桌面上摆着这 张“答题卡”,我们手里有 100 张筹码,需要把它们分给这些回答。

一条回答越值得模型以后继续生成,就分到越多筹码;不太好的回答,筹码就少一些。无论怎么分,总数始终是 100。

这张“筹码分配表”,就是 response simplex 想表达的东西:它不再单独看某一条回答,而是看整组回答之间的相对概率关系。严格来说,这里的“筹码”表示当前策略相对行为策略对这些候选回答的归一化偏好,并不是把原始 token 概率直接搬过来。

这也是 listwise 的关键。

传统理解里,我们很容易把 GRPO 看成:“奖励高的回答往上推,奖励低的回答往下压。”

LPO 的视角则多问了一步:

推完之后,这K条回答之间究竟应该形成怎样的概率比例?

论文证明,在严格 on-policy 的位置上,标准 group-based policy gradient 可以理解为:先由 advantage 隐式形成一个目标分布,再用反向 KL 的一阶近似向它靠近。

如果省略推导,核心目标可以浓缩成一条式子:

这里的 可以理解为“理想的筹码分配方案”, 是每条回答拿到的奖励, 决定分配有多激进。

较小时,筹码会更集中到少数高奖励回答; 较大时,分布更平缓,其他回答也能保留一定概率。

从这个角度看,GRPO、Dr.GRPO、MaxRL 之间很多看似复杂的 normalization 差异,其实都在影响同一件事:目标分布到底要有多尖。

问题在于,过去这个目标是“隐式”的,而且策略梯度只是在当前位置附近做一阶近似。模型参数一旦离采样时的策略越来越远,这个近似也会越来越不精确。

LPO 的思路因此非常直接:既然目标已经能写出来,为什么还要让策略梯度猜?

02


LPO 做的事:先定“筹码怎么分”,

再决定“怎么走过去”

LPO 把原来绑在一起的优化过程拆成了两步。

第一步,明确目标:哪些回答应该拿到更多概率,哪些应该少一些。

第二步,再决定当前模型应该用什么几何方式向这个目标分布靠近。


论文实现了两个代表性版本:

:使用前向 KL,更偏向 mode-covering;

:使用反向 KL,更偏向 mode-seeking。

如果继续沿用“筹码”的比喻,两者区别可以粗略理解为:

反向 KL 更愿意把筹码集中到最有希望的几个答案上;前向 KL 则更在意不要漏掉目标分布里其他仍然值得保留的答案。

放到推理训练中,这个区别就很关键。

一道数学题可能有代数解、几何解,也可能有不同长度的推导;一道代码题也可能存在完全不同的数据结构与算法路径。它们最后都能得到正确答案,但中间过程并不相同。

如果训练太早把概率压到一种高频模板上,模型的 也许还能提高,但继续采样时能找到的“其他路”可能越来越少。

而前向 KL 的 mode-covering 属性,恰好给了这些有效路径更多生存空间。

这也是为什么论文里最值得关注的结果,不只是单次准确率,而是 。

03


最关键的实验:

不是“第一次答得更准”,

而是多次采样时还有别的路

论文覆盖逻辑推理、数学推理、代码生成和多模态几何推理,模型包括 Qwen、DeepSeek、Mistral、Llama 等多个家族。

为了避免“只是温度调得更好”的质疑,研究者给 GRPO、Dr.GRPO、MaxRL 分别配套了完全相同 的 LPO 版本。

因此,这组实验真正比较的是:

在目标分布相同的情况下,显式 listwise projection,是否比策略梯度的一阶近似更有效?

先看 。

在全部 15 组严格配对设置中, 与 都有 13/15 组超过对应的 policy gradient 基线。


以 Qwen3-8B-Base 的数学评测为例:


其中,在 MaxRL 对应温度下,LPO 把平均 从 58.2 提高到 63.1;在 GRPO 对应温度下,平均 从 47.6 提高到 50.3。

Qwen3-1.7B-Base 上也有类似结果:GRPO 对应的 将数学基准平均 从 32.5 提高到 35.3,平均 从 42.1 提高到 46.1。

但真正把两种投影差异拉开的,是 。

关心的是:同一个问题连续采样多次,模型能不能至少找到一条正确路径。它既受单次准确率影响,也和模型是否还保留不同的有效推理模式有关。

结果非常整齐:


  • 对策略梯度基线15/15全部胜出;

  • 11/15

  • 直接比较两种 LPO,前向 KL 又在13/15组 设置中占优。



这组结果给出了一个相当清晰的信号:优化推理模型时,“不要过早丢掉其他正确路径”本身可能就是一种可利用的训练优势。

04


多样性没有换来更乱的训练,反而更稳

保留更多回答模式,很容易让人产生另一个疑问:模型会不会因此更难训练?

论文跟踪了 response entropy、gradient norm 和 response length,结果恰好相反。


两个 LPO 版本整体都保持了更高的 response entropy。这意味着模型没有很快坍缩到少数固定的回答模式,探索空间被保留得更久。

与此同时,LPO 的 gradient norm 普遍更低,波动也更小。

这和论文给出的理论性质一致:LPO 的投影梯度具有有界、零和与 self-correcting 特征。直观地说,一组回答是在同一个“概率预算”里竞争,提高一部分回答的相对概率,就会自然压低另一部分;当模型已经接近目标分布时,更新力度还会自动减弱。

论文还做了一个很重要的消融:如果保留同一个目标分布,却取消 listwise 的组内竞争结构,改成逐条回答独立做 pointwise projection,性能会明显下降。


这说明 LPO 的收益并不是简单来自“给正确回答更高权重”,而是来自整组回答之间的相对概率结构

换句话说,它优化的不是一张张独立答题卡,而是整桌答题卡之间的关系。

05


小样本、跨模型,以及一个

对 GRPO 理论解释的直接验证

论文还测试了不同 group size,范围为 。

在这些设置下,两种 LPO 都保持较强竞争力,而且在较小K 时优势尤其明显。这一点很有现实意义:每个 prompt 能采样的回答越少,训练得到的信息越有限,更新通常也越容易受噪声影响;LPO 在小 group 下仍能维持优势,说明显式投影在有限样本条件下依然有效。


两种版本的倾向也再次出现: 更偏向 , 在 上扩展得更好。

研究者随后把实验扩展到 Qwen、DeepSeek、Mistral 和 Llama 四类模型家族,覆盖 base、distilled、instruction-tuned 等不同训练范式。在 Countdown 任务中,LPO 在这些主干上都能超过对应策略梯度基线,尤其在 上保持稳定收益。


还有一组实验很适合用来理解论文对 GRPO 的重新解释。

理论上,在严格 on-policy 的位置,group-based policy gradient 应当等价于反向 KL 投影的一阶梯度。研究者因此设置 fully on-policy 实验,每轮只做一次梯度更新,尽量避免策略和采样分布发生漂移。

结果中, 与 GRPO 的训练曲线几乎重合。


这使“GRPO 可以被理解成隐式反向 KL 投影的一阶近似”不只停留在公式推导上,也得到了直接的实验对应。

与此同时, 仍然表现出不同的探索特征和更好的 。也就是说,把 target 与 projection 拆开之后,确实出现了传统 GRPO 更新无法自然提供的新设计空间。

06


OOD 泛化:平均结果继续提升,

但并不是所有任务都同步上涨

除了训练域内的推理能力,论文还测试了数学训练之后的 OOD 泛化,评测覆盖 MMLU-Pro、ARC-c 和 GPQA-diamond。

三组与策略梯度基线的配对结果如下:


三组平均分都出现提升,其中 Dr.GRPO 对应的 LPO 从 37.5 提升到 40.2,增幅最明显。

不过,这组结果也需要谨慎理解。具体到单项任务时,并不是 MMLU-Pro、ARC-c 和 GPQA-diamond 都会同步上涨,部分设置仍有波动。论文因此没有把 OOD 结果包装成“全面泛化提升”,而是认为跨领域泛化本身存在较大任务方差,后续仍值得通过多领域联合训练继续验证。

这一点也为后面的行业讨论划出了一条边界:LPO 已经证明了显式控制回答分布能够改善多种推理任务中的优化与多样性,但它还不是一个可以无条件解决所有泛化问题的万能解法。

07


DeepSeek-R1 之后,为什么行业

会越来越在意“不止一种解法”?

如果把这篇论文放回推理模型的行业语境里,它讨论的其实是一个比“换一种 loss”更大的问题。

DeepSeek-R1 让更多人看到,RLVR 可以直接推动模型的长程推理能力。但当这条路线继续向更复杂的数学、代码和 Agent 任务延伸时,训练目标不能只剩下“让最高奖励的答案概率更大”。

原因很简单:现实里的复杂任务,往往没有唯一的可行轨迹。

一个代码 Agent 修复 bug,可能先读日志,也可能先定位最近一次提交;一个搜索 Agent 面对证据不足时,可以换关键词、换来源、换推理链;一道数学题更可能同时存在几条完全不同的正确路径。

如果强化学习长期只把概率压向当前最占优势的那一种模板,模型可能越来越擅长重复已经学会的路径,却逐渐失去“换一种办法”的能力。

从这个角度看, 就不只是一个评测数字。它更像是在问:当第一次尝试不理想时,模型的分布里还剩多少条可以重新出发的路?

LPO 的意义也因此更清楚。

它没有假设“多样性越高越好”,而是把过去隐含在梯度里的概率竞争关系显式化,让研究者可以分别控制两件事:

1. 最终想让哪些回答获得多少概率;

2. 用什么投影方式靠近这个目标。

前向 KL 在 上的 15/15 胜出,则进一步给出一个值得行业继续验证的方向:对于需要搜索、重试、规划和多轨迹探索的推理模型,显式保留有效模式,可能比单纯追求最强单一路径更重要。

这并不意味着 LPO 已经解决了“推理多样性”的全部问题。论文的 OOD 测试也显示,跨领域收益仍有明显任务方差:三组配对平均分都有提升,但具体到 MMLU-Pro、ARC-c、GPQA-diamond,并不是每个单项都同步上涨。

因此,更稳妥的判断是:LPO 提供了一种新的优化视角,而不是一个已经被证明适用于所有场景的最终答案。

过去,group-based RLVR 的大量改进都围绕 advantage normalization、clipping 和训练稳定性展开。LPO 则把问题往前推了一层:

与其只问“这次梯度该有多大”,不如先问“我们究竟希望这一组答案最后变成什么分布”。

当“目标分布”和“如何投影”可以被分别设计后,推理模型后训练也就多了一条新的研究路径:不只训练模型更容易答对,也训练它不要太早忘掉其他能够答对的方法。

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Qvv0909777,备注:IJCAI+ 单位/学校+姓名+方向

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1948年,袁世凯长子落魄街头以捡烂菜叶糊口,表弟张伯驹接他回家

1948年,袁世凯长子落魄街头以捡烂菜叶糊口,表弟张伯驹接他回家

磊子讲史
2026-01-12 11:49:13
金敏喜洪尚秀带孩子出席活动,金敏喜素颜好憔悴,洪尚秀一直看娃

金敏喜洪尚秀带孩子出席活动,金敏喜素颜好憔悴,洪尚秀一直看娃

可乐谈情感
2026-08-14 02:57:47
大衣哥也没想到,郭兰英离世仅1天,于文华竟因一个举动大赚口碑

大衣哥也没想到,郭兰英离世仅1天,于文华竟因一个举动大赚口碑

80后房车生活
2026-08-14 00:41:28
“再宠下去,你女儿33岁都嫁不出去”,爸爸喂饭视频火了,外人不给面子

“再宠下去,你女儿33岁都嫁不出去”,爸爸喂饭视频火了,外人不给面子

泽泽先生
2026-08-14 09:18:52
儿子换房我补贴 40 万,我问住哪儿,儿媳反应让我决定一分不给

儿子换房我补贴 40 万,我问住哪儿,儿媳反应让我决定一分不给

兰姐说故事
2025-05-19 20:00:05
千年难遇的美人,太漂亮了,没有一点毛病,太完美了

千年难遇的美人,太漂亮了,没有一点毛病,太完美了

手工制作阿歼
2026-08-02 03:16:29
最后的疯狂:许家印被抓捕的失控三秒钟

最后的疯狂:许家印被抓捕的失控三秒钟

财经保探长
2026-04-09 22:30:38
80年代家喻户晓的女演员,嫁给军委副主席儿子,离婚后混得如何?

80年代家喻户晓的女演员,嫁给军委副主席儿子,离婚后混得如何?

新一说史
2026-08-05 23:17:22
男子应聘当“鸭子”,陪富婆1次能赚4千,2016年富婆竟是假冒的,数百男人上当

男子应聘当“鸭子”,陪富婆1次能赚4千,2016年富婆竟是假冒的,数百男人上当

汉史趣闻
2026-08-13 21:14:21
CCTV5直播,10-0,王艺迪VS日本大藤沙月、石洵瑶VS日本木原美悠

CCTV5直播,10-0,王艺迪VS日本大藤沙月、石洵瑶VS日本木原美悠

野渡舟山人
2026-08-14 09:54:40
四川考生644分,被华南理工大学录取!放弃入学选择复读,父母已同意,网友:为何不转专业?

四川考生644分,被华南理工大学录取!放弃入学选择复读,父母已同意,网友:为何不转专业?

王大嘴评说
2026-08-11 22:45:48
场均26+5+4,杜兰特或为阿门腾位置?2米11改打2号位,火箭占尽优势

场均26+5+4,杜兰特或为阿门腾位置?2米11改打2号位,火箭占尽优势

熊哥爱篮球
2026-08-14 15:41:55
杜锋离任状态相当好!观战男篮热身,与郭士强畅谈,宠爱2爱徒

杜锋离任状态相当好!观战男篮热身,与郭士强畅谈,宠爱2爱徒

篮球资讯达人
2026-08-14 14:35:18
1.2亿英镑+今日17时截止,切尔西对曼城下达恩佐最后通牒

1.2亿英镑+今日17时截止,切尔西对曼城下达恩佐最后通牒

篮坛第一线
2026-08-14 15:17:39
炸了!普京一脚踏上争议岛屿,当众吃口鱼子酱,日本首相直接破防:绝对无法容忍!

炸了!普京一脚踏上争议岛屿,当众吃口鱼子酱,日本首相直接破防:绝对无法容忍!

科技虎虎
2026-08-13 20:13:03
46岁张静初,一身腱子肉,体脂仅19%!她说:人生下半场就是拼肌肉

46岁张静初,一身腱子肉,体脂仅19%!她说:人生下半场就是拼肌肉

小方说跑步
2026-07-28 14:16:34
举过头顶,维蒂尼亚举起不同奖杯始终保持同一姿势

举过头顶,维蒂尼亚举起不同奖杯始终保持同一姿势

懂球帝
2026-08-13 19:09:10
隐居英国传闻真相大白,顾长卫儿子长相逼人,亲手撕下蒋雯丽体面

隐居英国传闻真相大白,顾长卫儿子长相逼人,亲手撕下蒋雯丽体面

观察者海风
2026-07-26 06:13:35
未来4年还能躺赚7750万美元!比尔总薪水突破4.2亿

未来4年还能躺赚7750万美元!比尔总薪水突破4.2亿

体坛周报
2026-08-14 11:13:20
河智苑48岁再跳《Home Run》,120万观看承诺兑现震惊全场

河智苑48岁再跳《Home Run》,120万观看承诺兑现震惊全场

山月不知2
2026-08-14 11:09:25
2026-08-14 16:07:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7537文章数 20774关注度
往期回顾 全部

科技要闻

DeepSeek大招:开发者狂喜 普通人用不明白

头条要闻

弟弟举报哥哥冒名上大学 哥哥回应:和弟弟是双胞胎

头条要闻

弟弟举报哥哥冒名上大学 哥哥回应:和弟弟是双胞胎

体育要闻

离开雷霆后,威少再也没成为威少

娱乐要闻

郭德纲会犯这种错,是因为被捧的太高

财经要闻

梁文锋,开始算账了

汽车要闻

越野/新能源/豪华全覆盖 成都车展重磅新车前瞻

态度原创

家居
本地
健康
游戏
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

黄景藏用半刀泥刻瓷都魂

孩子高低肩,是不是脊柱侧弯了?!

外媒记者批评《火焰纹章》新作性取向 男的怎么都喜欢女的?

军事要闻

特朗普下令美海军弃用电磁弹射系统 改回蒸汽弹射

无障碍浏览 进入关怀版