网易首页 > 网易号 > 正文 申请入驻

北航、北大和美团联合提出:策略提升强化学习!

0
分享至





来自北航、北大、美团的研究团队提出了Policy Improvement Reinforcement Learning,PIRL,以及对应的落地算法PIPO。这项工作关注的是大模型 RL 后训练中一个非常基础、但长期被默认跳过的问题:一次更新在当前数据上看起来优化了学习信号,是否就真的说明模型策略变强了?

过去很多 RL 后训练方法主要回答的是:当前这批轨迹该怎么学?

PIRL/PIPO 进一步追问的是:这一步学完之后,模型真的进步了吗?如果进步了,能否进一步巩固这一方向?如果没有进步,甚至带来了负面影响,能否及时削弱或校正这次更新?



  • 论文标题:Policy Improvement Reinforcement Learning
  • 论文:https://arxiv.org/abs/2604.00860
  • 代码:https://github.com/JacckMa/pipo_verl

主要贡献

  • 提出PIRL这一新的强化学习后训练视角。它不只看当前批次里的奖励、优势估计或教师信号,而是把跨迭代的策略提升本身作为优化目标
  • 提出PIPO这一即插即用的闭环优化框架。PIPO 可以直接接入几乎现有所有的 RL 后训练算法,如 PPO、GRPO、DAPO 和自蒸馏等方法。它不替代原方法中的局部学习信号,而是在其外层加入一层 “回头验证” 机制:对确实带来策略提升的更新方向进行进一步放大,对未能带来提升甚至造成性能下降的更新方向进行抑制、抵消或反向校正。
  • 在数学推理、代码、工具调用和自蒸馏设置下进行验证。实验显示,PIPO 在多种基础算法和任务场景中都带来了一致提升。

背景:RL 后训练已经很强,

但仍然是 “开环” 的

这两年,大模型继续变强的一个关键绝招,就是 RL post-training。

从经典的 PPO,到推理任务里常见的 GRPO、DAPO、GSPO,再到利用模型自身轨迹和反馈进行学习的 OPD 与自蒸馏,方法越来越多,效果也越来越强。它们都在解决一个核心问题:如何把当前这批数据里的奖励、优势估计、执行反馈或教师信号,转化成一次有效的参数更新,探索出新策略。

这些方法当然能推动策略变强,这也是 RL 后训练成为主流范式的原因。但它们大多还有一个共同特点:优化主要发生在当前采样轨迹上。也就是说,算法会认真计算当前这批轨迹该怎么学,却很少显式验证这一步学完之后,新的策略是否真的比过去更好。

这就是本文所说的开环优化。开环并不意味着方法无效,而是说训练过程少了一个关键环节:更新之后的效果验证,以及基于验证结果对上一轮更新方向进行回溯校正。

RL 后训练不能只盯着当前批次里的局部信号,还需要一个跨时间的验证机制,以及能够对历史更新方向进行再加权、抑制或校正的回溯调整机制。

PIRL:把 “策略提升” 本身变成优化目标







论文在理论上证明了:这个目标不会改变最终优化方向。对于固定初始策略,最大化累计策略提升,和最大化最终策略性能是对齐的;也就是说,这种目标改写并没有偏离最终想要的模型能力。

因此,PIRL 并不是否定奖励、优势或教师信号,而是补上它们缺少的一环:更新之后,要验证这一步有没有真的转化成策略提升。

PIPO:让训练过程学会 “回头看”

基于 PIRL,论文进一步提出了Policy Improvement Policy Optimization, PIPO。它的核心是两步:先让基础算法正常探索,再在下一轮利用策略提升反馈回头验证这次探索是否真的带来了策略进步。如果新策略相较历史基准表现更好,PIPO 会认为上轮更新方向与策略提升一致,从而进一步放大、巩固这一方向;如果新策略没有带来提升,甚至导致性能下降,PIPO 则会削弱该更新方向的影响,必要时通过回溯校正在优化意义上抵消有害更新。



这一步回答的是:当前这批轨迹该怎么学?









因此,策略提升目标可以被写成类似 PPO 的裁剪形式:







这样一来,PIPO 就可以在 PPO、GRPO、SDPO 等原有方法基础上即插即用地加入跨迭代验证。它把单批次内的局部学习信号和批次之间的历史表现联系起来,让每次更新都多一道判断:这次更新之后,模型整体有没有更强?如果变强,就巩固有效的更新方向;如果变弱,就削弱有害的更新影响。由此,原本开环的 RL 后训练被转化为带有策略提升反馈的闭环优化过程。

实验验证

论文首先在数学推理任务上验证 PIPO。

结果显示,PIPO 接到 PPO、GRPO、GSPO、DAPO 后,平均表现、思考长度都有所提升。





PIPO 不是只对数学推理有效。论文进一步在代码任务和工具调用任务上进行了实验验证。论文还验证了 PIPO 在自蒸馏设置下的提升作用。





结语:RL 后训练需要更好的闭环

过去很多 RL 后训练方法在努力回答一个问题:当前这批轨迹该怎么学?PIRL/PIPO 进一步追问:这一步学完之后,模型真的变强了吗?

这也是本文最核心的观点:RL post-training 不能只盯着当前批次里的奖励、优势估计或教师信号。真正重要的是,每次更新之后,模型有没有产生可验证的策略提升,从而对更新进行动态的强化或者削弱。

PIRL 把 “进步” 本身定义为优化目标。PIPO 则把这个目标变成了一个可以接入现有算法的闭环训练框架。

如果说传统 RL 后训练更像是在不断根据当前信号往前走,那么 PIRL/PIPO 想做的是:让模型每走一步,都回头看一眼,确认自己是不是真的在变强,并进一步巩固有效方向、校正有害影响。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
宇树科技盘中一度跌超17%

宇树科技盘中一度跌超17%

每日经济新闻
2026-08-20 09:39:07
啪啪打脸了!“弟弟举报哥哥冒名读大学”案证据出炉,哥哥唐时达陈述的证据,印证弟弟潘峰才是原始的“唐时达”

啪啪打脸了!“弟弟举报哥哥冒名读大学”案证据出炉,哥哥唐时达陈述的证据,印证弟弟潘峰才是原始的“唐时达”

火山詩话
2026-08-20 07:11:25
秦皇岛一底商火灾致8死3伤,现场画面曝光,附近商家:一家酒吧起火,酒吧外车辆被烧

秦皇岛一底商火灾致8死3伤,现场画面曝光,附近商家:一家酒吧起火,酒吧外车辆被烧

潇湘晨报
2026-08-20 13:03:19
上海优化房地产政策措施,精准施策促进合理购房需求积极释放

上海优化房地产政策措施,精准施策促进合理购房需求积极释放

界面新闻
2026-08-20 12:51:19
宇树上市王兴兴全程平静,答谢宴上终于笑了!杯中液体引热议,是可乐还是红酒?网友调侃:感觉像个新郎官一样

宇树上市王兴兴全程平静,答谢宴上终于笑了!杯中液体引热议,是可乐还是红酒?网友调侃:感觉像个新郎官一样

金融界
2026-08-20 09:23:35
李嫣面相变了!素颜五官精致不显兔唇,和窦靖童同框抢眼超像王菲

李嫣面相变了!素颜五官精致不显兔唇,和窦靖童同框抢眼超像王菲

史之韵
2026-08-18 11:23:25
北大国发院副院长雷人言论:灵活就业是福利,不像我们朝九晚五,待遇好但没自由

北大国发院副院长雷人言论:灵活就业是福利,不像我们朝九晚五,待遇好但没自由

小徐讲八卦
2026-08-19 15:03:12
伊朗副总统吐槽中国车又烂又贵,推荐日本车,被美石油封锁致油荒

伊朗副总统吐槽中国车又烂又贵,推荐日本车,被美石油封锁致油荒

流史岁月
2026-08-19 15:00:03
杭州酒局通报终于来了!两人被刑拘免职,7·26案发到公布隔23天

杭州酒局通报终于来了!两人被刑拘免职,7·26案发到公布隔23天

天天热点见闻
2026-08-19 08:45:51
建发房产杭州总经理马政纲到底何许人也?

建发房产杭州总经理马政纲到底何许人也?

地产一品塘
2026-08-20 00:56:51
单靠华为就能突围?拆解华境S交付破2万台的真正底气

单靠华为就能突围?拆解华境S交付破2万台的真正底气

天天汽车
2026-08-20 09:33:40
差24米封顶,中建三局撤场!468米的西南第一高楼停工6年后央企接手

差24米封顶,中建三局撤场!468米的西南第一高楼停工6年后央企接手

童童聊娱乐啊
2026-08-20 06:49:59
大瓜!南宁骑行圈一女子被已婚男“拿下”,爆料男子哭诉称与她相恋数年,网友:你应该感谢对方帮你止损

大瓜!南宁骑行圈一女子被已婚男“拿下”,爆料男子哭诉称与她相恋数年,网友:你应该感谢对方帮你止损

火山詩话
2026-08-20 05:43:13
女子发问“我得了艾滋病,还有人要我吗?” 自称可以退步:可以不要彩礼!评论区一片恐慌,纷纷吐槽!

女子发问“我得了艾滋病,还有人要我吗?” 自称可以退步:可以不要彩礼!评论区一片恐慌,纷纷吐槽!

谭谈社会
2026-08-20 09:13:59
买座占零食当事人发声:不接受道德绑架,对方想要座位可以付钱

买座占零食当事人发声:不接受道德绑架,对方想要座位可以付钱

金牌娱乐
2026-08-20 09:08:42
钱再多有啥用?迪奥全球公关总监和丈夫同时去世,死因曝光太可惜

钱再多有啥用?迪奥全球公关总监和丈夫同时去世,死因曝光太可惜

嫹笔牂牂
2026-08-20 07:16:10
中央动真格!明年底前,全国所有房子都将迎来唯一“身份证”

中央动真格!明年底前,全国所有房子都将迎来唯一“身份证”

巢客HOME
2026-08-20 05:30:03
涉嫌性丑闻!中国足协3嫌疑人疑曝光:2人入狱1人判13年 1人高升

涉嫌性丑闻!中国足协3嫌疑人疑曝光:2人入狱1人判13年 1人高升

念洲
2026-08-20 09:00:39
董毓民已任杭州市委常委、余杭区委书记

董毓民已任杭州市委常委、余杭区委书记

上观新闻
2026-08-20 07:48:09
唐时达诉湘潭大学案,被告三连问:没冒名顶替为何支付360万;养母儿子邻居为何作出不利证言 ;潘涛在哪

唐时达诉湘潭大学案,被告三连问:没冒名顶替为何支付360万;养母儿子邻居为何作出不利证言 ;潘涛在哪

老郭在学习
2026-08-20 12:02:03
2026-08-20 13:52:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13797文章数 142722关注度
往期回顾 全部

科技要闻

DeepSeek Harness更新多模态支持

头条要闻

许家印被判无期徒刑 恒大集团、恒大地产等案一审宣判

头条要闻

许家印被判无期徒刑 恒大集团、恒大地产等案一审宣判

体育要闻

拥有“儿皇梦”的罗德里,为何选择巴萨?

娱乐要闻

汪峰也没想到章子怡,挖到了一条财路

财经要闻

许家印被判处无期 恒大集团被罚88.2亿

汽车要闻

城区油耗3L级 长安CS55蓝鲸超擎混动 7.99万起

态度原创

时尚
手机
艺术
房产
数码

内娱还在三件套的时候,韩综已经卷到“扛大炮”了

手机要闻

小米米家旅行箱全新浅蓝配色开售:三款可选,219元起

艺术要闻

251米!宁波第三高楼来了,长得像棵大树!

房产要闻

265亿资产甩出!三亚老牌地产巨头,正在集体退场!

数码要闻

泰坦军团推出QD Mini LED曲面显示器M34E7S:34" UWQHD 240Hz

无障碍浏览 进入关怀版