网易首页 > 网易号 > 正文 申请入驻

小红书团队给AI的每一步打分,代码通过率冲到67.4%

0
分享至

一个数学Agent要经历长篇推理才能得到正确答案,一个Coding Agent要经过多次检索、修改和测试才能修好程序。最终的成功可以被验证,但沿途的每一步乃至每个Token,究竟应该获得多少Credit?

这是强化学习中的Credit Assignment问题。对于长程Agent,它直接关系到模型如何从一个最终结果中学习成千上万次决策。给Credit一个明确的数学刻画,能否帮助我们理解现有算法,并进一步改进训练?


小红书AllSpark团队提出三个正则条件,证明满足这些条件的信用分配存在且唯一,并据此分析OPD、RLOO和GAE中的训练现象。在此基础上,团队提出PACT,改进Critic的回归与策略对齐。在SWE-bench Verified上,PACT达到67.4% Pass Rate,较GRPO提高2.0个百分点;在四个数学推理基准上,平均准确率达到72.87%,较GRPO提高8.80个百分点。

最终奖励背后,藏着无效探索和关键纠错

在许多大模型强化学习任务中,奖励只在轨迹结束时给出。答案对不对,测试过没过,这些结果比较明确。但同一个最终奖励背后,可能包含正确的中间推理、无效的探索,也可能包含一次关键的纠错。

不同训练方法处理这个问题的方式并不相同。RLOO、GRPO等方法构造组级基线,并将得到的优势用于每个Token的更新;OPD则利用教师与学生的分布差异,为每个Token提供更细粒度的信号。

这些量都能驱动模型更新,但它们与Credit本身是什么关系?OPD里的教师与Critic之间又是否存在联系?

讨论这些问题,需要先明确Credit指什么。本文从它应满足的条件出发,确定后续分析所使用的数学对象。对于需要多轮推理和工具调用的Agent,这也关系到一个实际的训练选择:如何利用最终成败,学习中间的决策。

三个条件,锁定唯一的信用分配

团队提出三个正则条件,对Credit Assignment作出约束。

  • 完整性:所有Credit相加,应完整解释最终奖励相对于初始预期的偏差。
  • 前缀一致性:对同一个已经生成的前缀,累计Credit应保持一致,不能因为后续轨迹的不同而被重新改写。
  • 中立性:在下一步尚未发生时,基于当前已有的信息,下一个Token的Credit条件期望应为零。

论文证明,满足这三个条件的Credit存在且唯一。其中V表示给定当前历史时对最终奖励的条件期望。每一步的Credit,就是这一步及其关联的环境反馈揭示后,预期最终奖励发生的变化。

例如,在修复代码时,一次修改及其测试反馈,可能让模型对最终成功的预期上升,也可能让预期下降。这里的Credit对应这种预期的变化,而不是把最后一次测试的成败直接复制给此前的每个动作。条件期望还取决于后续使用的策略,因此同一段历史下的Value也会随策略变化。

类似于熵的公理化刻画,这里的问题是哪些条件能够唯一确定所研究的对象。前人曾在特定设置下得到类似形式;本文证明,在这三个条件下,Credit被唯一确定,后续可以围绕这一对象研究估计方法。

OPD的教师,其实是个隐式Critic

OPD通过教师与学生之间的KL目标训练模型,通常不需要一个显式的Value Head。它与依赖Critic的强化学习之间,存在怎样的联系?

论文考虑一个兼顾奖励提升与偏离学生策略代价的理想教师,并证明,在这一假设下,OPD的期望策略梯度与唯一Credit表示诱导的策略梯度成比例。因此,教师可以被理解为一个隐式Critic。

RLOO用同一Prompt下其他响应的平均奖励作为基线,将当前响应的奖励减去这一基线,得到用于各个Token更新的响应级优势。这个优势本身不是Token-Level Credit,但它产生的期望梯度贡献与使用唯一Credit时相同。两者仍可能有不同的采样噪声,因此,梯度等价并不意味着统计效率相同。

论文还证明,对任意固定幅度,有界奖励下超过该幅度的Credit的期望数量有一个不随最大轨迹长度增长的上界,这就是近似Credit稀疏性。当局部Credit较小时,GAE中保留的中间Critic误差可能干扰优势估计。取λ=1可以消除这些中间误差项,这也是PACT的选择。

PACT:让Critic回归Value,并跟上Actor

Credit与Value的变化紧密相关。接下来的问题是,如何让Critic更准确地回归Value,并跟上正在更新的策略?

PACT的全称是Policy Aligned Critic Training,分别调整Value的回归目标与Actor、Critic的更新流程。

对于有界最终奖励,可以通过正仿射变换将其归一化到[0,1],而不改变最优策略。PACT用二元交叉熵(BCE)替代均方误差(MSE)来回归Value。在这一设置下,两者的最优预测都是奖励的条件期望。在固定策略的对照实验中,BCE Critic在两种模型规模上都收敛更快、回归误差更低,也能更清楚地区分成功与失败轨迹的Value。

Actor更新后,同一个前缀下后续生成的分布会发生变化,对应的Value也可能改变。在本文研究的PPO训练流程中,Actor和Critic都使用旧策略采集的轨迹。Actor完成更新时,Critic并没有随之对齐新策略。

PACT采用Actor-Then-Critic的顺序,先更新Actor,再利用新策略的概率对Critic训练进行重要性采样修正,使其更好地对齐更新后的策略。整个过程复用已有轨迹,只需额外进行一次更新后Actor的前向计算。实际实现使用局部重要性比率,并屏蔽范围外的样本。

代码与数学任务上的实测数字

在代码任务中,团队使用Qwen3.6-35B-A3B,在OpenSWE上训练。PACT在SWE-bench Verified上达到67.4% Pass Rate,相比GRPO、PPO和SAO,分别提高2.0、2.4和3.8个百分点。

在Qwen3.5-4B上,团队使用OpenCode在DAPO-Math-17k的3,200道题目子集上训练。PACT在AIME 2025、AIME 2026、BeyondAIME和HMMT November 2025四个基准上均优于所比较的方法,Avg@16平均准确率达到72.87%,较GRPO和PPO(λ=1)分别提高8.80和13.16个百分点。

团队还比较了有无Critic重要性采样修正的结果。保持更新顺序、BCE目标和Actor侧设置不变,仅移除Critic IS,数学平均准确率从72.87%降至67.74%。加入修正后,平均提高5.13个百分点,四个基准均有提升。

对长程Agent的训练,这项工作给出了一个可供分析和估计的Credit对象。它解释了教师如何承担隐式Critic的作用、响应级优势为何能产生相同的期望梯度,以及中间Value误差如何进入GAE。PACT则据此调整Critic的回归与更新流程,并在数学和代码任务上检验了效果。

信用分配被确定下来后,训练方法就有了明确的估计对象,也可以进一步研究怎样减少估计误差、让Critic跟上策略的变化。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
53张图片泄露之“慌”,AI安全谁来负责?

53张图片泄露之“慌”,AI安全谁来负责?

经济观察报
2026-09-28 14:03:06
罗永浩迎来全面“围剿”,源自于《人民网》对其一针见血的定性!

罗永浩迎来全面“围剿”,源自于《人民网》对其一针见血的定性!

玖宇维
2026-09-29 15:44:16
27年前火遍上海的品牌,回归了!首店大排百米长队

27年前火遍上海的品牌,回归了!首店大排百米长队

看看新闻Knews
2026-09-29 10:22:33
5万页“核弹”直捣欧足联!皇马要求剥夺巴萨17年全部冠军,欧战禁赛随时落地

5万页“核弹”直捣欧足联!皇马要求剥夺巴萨17年全部冠军,欧战禁赛随时落地

寒律
2026-09-29 11:48:40
比芯片更可怕的危机来了?人类挖了几千年的铜,竟成未来命门!

比芯片更可怕的危机来了?人类挖了几千年的铜,竟成未来命门!

晓鰀爱八卦
2026-09-28 14:11:01
隐匿在大陆的“台独”媒体人狂言:两岸开战炸港口,就能锁死大陆

隐匿在大陆的“台独”媒体人狂言:两岸开战炸港口,就能锁死大陆

甜心猫独宠
2026-09-29 04:06:53
舆论反转了!“矿山是你娘家人”出圈,崔培军劝阻加班被质疑作秀,网友:就是作秀,也得掏真金白银,你要不服的话,你做一个试试

舆论反转了!“矿山是你娘家人”出圈,崔培军劝阻加班被质疑作秀,网友:就是作秀,也得掏真金白银,你要不服的话,你做一个试试

火山詩话
2026-09-29 08:05:26
比亚迪高颜值轿跑,海洋美学2.0设计,搭载插混/纯电两套动力

比亚迪高颜值轿跑,海洋美学2.0设计,搭载插混/纯电两套动力

侃故事的阿庆
2026-09-30 03:03:40
1986年,四川老头花10块钱入股农村信用社,27年后的分红把他吓坏

1986年,四川老头花10块钱入股农村信用社,27年后的分红把他吓坏

猫眼观史
2025-01-03 15:50:44
汉朝公主赴匈奴和亲,大多都无法产下子嗣,因为匈奴有一个陋习

汉朝公主赴匈奴和亲,大多都无法产下子嗣,因为匈奴有一个陋习

萧竹轻语
2025-08-15 17:02:21
不是降息,是贴息!中央对房地产出手这步棋,藏着三个深层信号

不是降息,是贴息!中央对房地产出手这步棋,藏着三个深层信号

海豚商业研究院
2026-09-29 19:34:00
早田希娜:所有项目都输给了中国,心里满是不甘

早田希娜:所有项目都输给了中国,心里满是不甘

懂球帝
2026-09-29 11:39:11
当着中方代表面!巴总统联大摊牌:拒绝台海中立,叫嚣推台当局入联

当着中方代表面!巴总统联大摊牌:拒绝台海中立,叫嚣推台当局入联

南风不及你温柔
2026-09-29 05:34:04
张家齐直播回应“被指说话强势”:我要是不强势,我就不会是奥运冠军;此前张家齐在综艺中与母亲相处模式引热议

张家齐直播回应“被指说话强势”:我要是不强势,我就不会是奥运冠军;此前张家齐在综艺中与母亲相处模式引热议

极目新闻
2026-09-29 11:29:47
被追债百万的老戏骨王双宝近况有点“惨”! 独自坐在饭店内,店内杂乱不堪

被追债百万的老戏骨王双宝近况有点“惨”! 独自坐在饭店内,店内杂乱不堪

裕丰娱间说
2026-09-27 14:01:01
日乒公布亚锦赛名单,林诗栋迎来真正考验!水谷隼:打败王楚钦就能赢——可他这次没来

日乒公布亚锦赛名单,林诗栋迎来真正考验!水谷隼:打败王楚钦就能赢——可他这次没来

好乒乓
2026-09-29 15:23:30
CCTV5直播!国足VS世界第96,主力阵容或大换血,邵佳一迎“正名之战”

CCTV5直播!国足VS世界第96,主力阵容或大换血,邵佳一迎“正名之战”

大卫的篮球故事
2026-09-29 16:44:03
人挤人!昌平新商场爆火,但吐槽的也真多!

人挤人!昌平新商场爆火,但吐槽的也真多!

昌平早知道
2026-09-29 17:24:04
武契奇认输辞职?他只是换了“战场”!

武契奇认输辞职?他只是换了“战场”!

看看新闻Knews
2026-09-28 23:52:04
裴轶被北理工解聘仅仅是拔掉一根毒草,高校文科打拳女教授的脏土还有待强力净化

裴轶被北理工解聘仅仅是拔掉一根毒草,高校文科打拳女教授的脏土还有待强力净化

少爷写春秋
2026-09-30 00:32:15
2026-09-30 08:11:00
固件更新中
固件更新中
有态度网友ytd
207文章数 77关注度
往期回顾 全部

科技要闻

82亿美元收购!李飞飞将与苏姿丰并肩做AI

头条要闻

杭州女孩天天坐高铁去上海上班 通勤6小时每月花3000

头条要闻

杭州女孩天天坐高铁去上海上班 通勤6小时每月花3000

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

央行调整完善若干货币政策工具

汽车要闻

搭华为乾崑ADS 5/设计风格换新 2027款纵横G700售30.49万起

态度原创

旅游
本地
家居
时尚
公开课

旅游要闻

石家庄市植物园:10万余株花卉缤纷绽放

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

家居要闻

2026建博会(广州) 公装联探展交流活动

老板,我的脑子好像忘在家里了

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版