一个数学Agent要经历长篇推理才能得到正确答案,一个Coding Agent要经过多次检索、修改和测试才能修好程序。最终的成功可以被验证,但沿途的每一步乃至每个Token,究竟应该获得多少Credit?
这是强化学习中的Credit Assignment问题。对于长程Agent,它直接关系到模型如何从一个最终结果中学习成千上万次决策。给Credit一个明确的数学刻画,能否帮助我们理解现有算法,并进一步改进训练?
![]()
小红书AllSpark团队提出三个正则条件,证明满足这些条件的信用分配存在且唯一,并据此分析OPD、RLOO和GAE中的训练现象。在此基础上,团队提出PACT,改进Critic的回归与策略对齐。在SWE-bench Verified上,PACT达到67.4% Pass Rate,较GRPO提高2.0个百分点;在四个数学推理基准上,平均准确率达到72.87%,较GRPO提高8.80个百分点。
同一个最终奖励,藏着不同的中间过程
在许多大模型强化学习任务中,奖励只在轨迹结束时给出。答案对不对,测试过没过,这些结果比较明确。但同一个最终奖励背后,可能包含正确的中间推理、无效的探索,也可能包含一次关键的纠错。
不同训练方法处理这个问题的方式并不相同。RLOO、GRPO等方法构造组级基线,并将得到的优势用于每个Token的更新;OPD则利用教师与学生的分布差异,为每个Token提供更细粒度的信号。
这些量都能驱动模型更新,但它们与Credit本身是什么关系?OPD里的教师与Critic之间又是否存在联系?
讨论这些问题,需要先明确Credit指什么。团队从它应满足的条件出发,确定后续分析所使用的数学对象。对于需要多轮推理和工具调用的Agent,这也关系到一个实际的训练选择:如何利用最终成败,学习中间的决策。
三条正则条件,锁定唯一的Credit
团队提出三个正则条件,对Credit Assignment作出约束。
- 完整性:所有Credit相加,应完整解释最终奖励相对于初始预期的偏差。
- 前缀一致性:对同一个已经生成的前缀,累计Credit应保持一致,不能因为后续轨迹的不同而被重新改写。
- 中立性:在下一步尚未发生时,基于当前已有的信息,下一个Token的Credit条件期望应为零。
论文证明,满足这三个条件的Credit存在且唯一。其中V表示给定当前历史时对最终奖励的条件期望。每一步的Credit,就是这一步及其关联的环境反馈揭示后,预期最终奖励发生的变化。
例如,在修复代码时,一次修改及其测试反馈,可能让模型对最终成功的预期上升,也可能让预期下降。这里的Credit对应这种预期的变化,而不是把最后一次测试的成败直接复制给此前的每个动作。条件期望还取决于后续使用的策略,因此同一段历史下的Value也会随策略变化。
类似于熵的公理化刻画,这里的问题是哪些条件能够唯一确定所研究的对象。前人曾在特定设置下得到类似形式;论文证明,在这三个条件下,Credit被唯一确定,后续可以围绕这一对象研究估计方法。
教师是隐式Critic,RLOO梯度等价但噪声不同
OPD通过教师与学生之间的KL目标训练模型,通常不需要一个显式的Value Head。它与依赖Critic的强化学习之间,存在怎样的联系?
论文考虑一个兼顾奖励提升与偏离学生策略代价的理想教师,并证明,在这一假设下,OPD的期望策略梯度与唯一Credit表示诱导的策略梯度成比例。因此,教师可以被理解为一个隐式Critic。
RLOO用同一Prompt下其他响应的平均奖励作为基线,将当前响应的奖励减去这一基线,得到用于各个Token更新的响应级优势。这个优势本身不是Token-Level Credit,但它产生的期望梯度贡献与使用唯一Credit时相同。两者仍可能有不同的采样噪声,因此,梯度等价并不意味着统计效率相同。
论文还证明,对任意固定幅度,有界奖励下超过该幅度的Credit的期望数量有一个不随最大轨迹长度增长的上界,这就是近似Credit稀疏性。当局部Credit较小时,GAE中保留的中间Critic误差可能干扰优势估计。取λ=1可以消除这些中间误差项,这也是PACT的选择。
PACT:让Critic回归更准,也跟上Actor
Credit与Value的变化紧密相关。接下来的问题是,如何让Critic更准确地回归Value,并跟上正在更新的策略?
PACT的全称是Policy Aligned Critic Training,分别调整Value的回归目标与Actor、Critic的更新流程。
对于有界最终奖励,可以通过正仿射变换将其归一化到[0,1],而不改变最优策略。PACT用二元交叉熵(BCE)替代均方误差(MSE)来回归Value。在这一设置下,两者的最优预测都是奖励的条件期望。在固定策略的对照实验中,BCE Critic在两种模型规模上都收敛更快、回归误差更低,也能更清楚地区分成功与失败轨迹的Value。
Actor更新后,同一个前缀下后续生成的分布会发生变化,对应的Value也可能改变。在本文研究的PPO训练流程中,Actor和Critic都使用旧策略采集的轨迹。Actor完成更新时,Critic并没有随之对齐新策略。
PACT采用Actor-Then-Critic的顺序,先更新Actor,再利用新策略的概率对Critic训练进行重要性采样修正,使其更好地对齐更新后的策略。整个过程复用已有轨迹,只需额外进行一次更新后Actor的前向计算。实际实现使用局部重要性比率,并屏蔽范围外的样本。
代码与数学任务上的实测数字
在代码任务中,团队使用Qwen3.6-35B-A3B,在OpenSWE上训练。PACT在SWE-bench Verified上达到67.4% Pass Rate,相比GRPO、PPO和SAO,分别提高2.0、2.4和3.8个百分点。
在Qwen3.5-4B上,团队使用OpenCode在DAPO-Math-17k的3,200道题目子集上训练。PACT在AIME 2025、AIME 2026、BeyondAIME和HMMT November 2025四个基准上均优于所比较的方法,Avg@16平均准确率达到72.87%,较GRPO和PPO(λ=1)分别提高8.80和13.16个百分点。
团队还比较了有无Critic重要性采样修正的结果。保持更新顺序、BCE目标和Actor侧设置不变,仅移除Critic IS,数学平均准确率从72.87%降至67.74%。加入修正后,平均提高5.13个百分点,四个基准均有提升。
对长程Agent的训练,这项工作给出了一个可供分析和估计的Credit对象。它解释了教师如何承担隐式Critic的作用、响应级优势为何能产生相同的期望梯度,以及中间Value误差如何进入GAE。PACT则据此调整Critic的回归与更新流程,并在数学和代码任务上检验了效果。
信用分配被确定下来后,训练方法就有了明确的估计对象,也可以进一步研究怎样减少估计误差、让Critic跟上策略的变化。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.