一个Agent在真实任务里连续调用几十次工具,最终只拿到一个0或1的终局奖励。这个分数到底该算在哪一步头上?是第一次搜索选错了关键词,还是中间某次API调用参数传反了,又或者是最后一步总结漏了关键信息?
这是长程Agent强化学习(Agentic RL)里最棘手的问题之一。最近一篇关于Apodex 1.1的技术分析,把这个问题拆成了两个层级来解决:先定位到"哪一段轨迹"出了问题,再细化到"哪一个token"该领多少credit。这套思路对正在做Agent训练的人来说,值得停下来看一眼。
![]()
一条成功轨迹,不代表每一步都值得强化
直接广播终局奖励的做法,在短任务里勉强能用,但一旦任务拉长到几十步,问题就暴露了:一条最终成功的轨迹里,可能只有少数几个决策真正决定了结果,其余大部分动作只是"跟着走";反过来,一条失败的轨迹里,也可能藏着几个正确的关键判断,只是被后面的错误拖累了。
把同一个0或1的奖励平均分给所有步骤,等于用噪声淹没信号。真正影响结果的少数决策,会被大量无关动作的梯度冲淡。这也是为什么长程Agent训练里,credit assignment(信用分配)比reward设计本身更卡脖子。
第一层:Pivot-RL,先定位到"片段"
Pivot-RL的思路是:不直接看整条轨迹,而是通过多次rollout的reward方差,找出那些"混合结果"的中间状态——同一个状态出发,有时候成功有时候失败。这种状态叫pivot,它才是真正能区分好坏动作的位置。
全成功或全失败的中间状态组,组内advantage为零,产生不了任何策略梯度。只有mixed-outcome的状态,才能提供"这个动作比那个动作好"的局部信号。Pivot-RL保留有效前缀,对局部continuation做优化,奖励的是功能等价的动作,而不是机械复现原轨迹。
换句话说,它先把"这次任务成败归因到哪段轨迹"这个问题解决掉,再进入下一层。
第二层:SAO,把credit分到token级
定位到片段之后,还需要把片段的return分配到具体的policy action token上。这里有个技术细节:标准GAE(广义优势估计)直接在相邻token间传播,会把observation token(环境返回的文本)也纳入advantage计算,引入大量噪声。
SAO的做法是single-rollout异步机制,用value model配合Skip-Observation GAE,跨过observation token,只连接action末端与下一个action起点。这样credit只在policy自己生成的决策之间传播,不给环境文本分配功劳。配合token-level clipping处理off-policy稳定性,整个机制在单次rollout内就能完成。
文章里有句话点得很透:我们要给policy的决策分配credit,而不是给环境observation分配credit。
value-pretrain:SAO能跑起来的前提
SAO依赖value model估计baseline,如果value model冷启动质量差,训练会直接崩溃。这是很多人在实践中踩过的坑——算法本身没问题,但value model一开始就是歪的,后面全白搭。
文章提到三个保障手段:扩大pretrain数据规模、更高频更新critic、冻结attention只更新MoE projections。三者分别解决初始化质量、跟踪速度和优化稳定性。没有这层value-pretrain打底,SAO的token级分配就是空中楼阁。
算法之外:环境、verifier和AgentOS缺一不可
credit assignment算法再精巧,也依赖底层基础设施提供可靠的信号。文章特别强调了三个前提条件:
- 可执行的verifier:如果verifier只能判断文本相似度,reward variance测的就是噪声而非决策质量,pivot筛选会失真。
- 正确的状态恢复(AgentOS):局部continuation必须面对与原始轨迹相同的环境状态,否则reward不可比较。AgentOS维护工作区、执行日志和任务状态,是片段级credit assignment落地的必要条件。
- 可扩展的环境:算法需要大量rollout才能找到mixed-outcome的pivot状态,环境跑不动就无从谈起。
这套组合拳的逻辑是:先判断一次任务的成败应该归因到哪段轨迹,再判断这段轨迹的credit应该怎样分到每个token。Pivot-RL负责前者,SAO负责后者,value-pretrain和AgentOS是两者能跑起来的地基。
四个还没答案的问题
文章最后留了四个追问,每一个都指向下一步的研究方向:联合训练时Pivot-RL和SAO的可加性如何保证?pivot边界的定义有没有更优解?value model的预测粒度应该细到什么程度?策略不确定性和verifier噪声怎么区分?
这些问题目前没有定论,但方向已经清晰:长程Agent的强化学习,瓶颈不在拿到reward,而在把稀疏的终局奖励正确分配到轨迹中的关键决策上。谁先把这条链路跑通,谁就能在Agent训练效率上拉开身位。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.