长程智能体任务要求模型连续做出数十步决策,而奖励只在任务结束时给出。现有轨迹级 RL 方法(如 GRPO)存在两大系统性缺陷:信用错配——早期正确动作会因后续失败而被惩罚,同一动作在不同轨迹中收到方向相反的梯度信号(峰值超 40% 更新含矛盾信号);样本低效——39% 的轨迹完成了至少一个子目标却因最终失败获得与完全失败相同的零奖励,超 73% 样本不提供学习信号。
BEACON 利用长程任务的组合式结构:用可验证的状态变化检测里程碑并切分轨迹;段内施加时间衰减的奖励塑造,将稀疏终端信号转为稠密反馈;双尺度优势估计在轨迹级捕捉全局表现、在段级仅与到达同一里程碑的轨迹比较,隔离后续失败的干扰。在 ALFWorld、WebShop、ScienceWorld 上全面超越 GRPO 与 GiGPO:长程 ALFWorld 任务成功率 92.9%(GRPO 仅 53.5%),有效样本利用率从 23.7% 提升至 82.0%(3.5×)。代码已开源(github.com/ZJU-REAL/BEACON)。
![]()
论文标题:
Milestone-Guided Policy Learning for Long-Horizon Language Agents
论文链接:
https://arxiv.org/abs/2605.06078
代码链接:
https://github.com/ZJU-REAL/BEACON
项目主页:
https://zju-real.github.io/BEACON/
一、引言:任务是一步步做的
奖励却只看最后一步
从网页购物、家居操作到科学实验,语言智能体要完成的任务越来越长,一条轨迹往往包含 30 步以上的连续决策。用强化学习训练这类智能体时,一个老问题变得格外突出:任务是一步一步完成的,但奖励只在最后一刻给出。
以主流的 GRPO 为例,它采用轨迹级的稀疏终局奖励,整条轨迹共享同一个优势值。短任务上这样做问题不大,放到长程任务里就会暴露两个缺陷:
•信用误分配(Credit Misattribution):前 20 步都走对了,第 25 步出错,整条轨迹被判负,前面那些正确动作也跟着一起挨罚。
•样本利用率低(Sample Inefficiency):长程任务的成功轨迹本来就少。一组 rollout 全部失败时,组内奖励方差为零,优势函数直接归零,这批样本对训练毫无贡献。
也就是说,模型最需要学习信号的地方,恰恰是信号最少的地方。
针对这两个问题,浙江大学联合百度提出了里程碑引导的策略学习框架 BEACON。
在 ALFWorld 长程任务上,成功率从 GRPO 的53.5% 提升到 92.9%,接近翻倍;有效样本利用率从 23.7% 提升到 82.0%。论文已被人工智能顶级会议 ICML 2026 录取,代码全部开源。
![]()
图1. GRPO 从终局结果向整条轨迹均匀分配信用,后期的失败会连带惩罚正确的早期动作。BEACON 在里程碑处切分轨迹,在两个尺度上估计优势,把局部动作的评价和后续段的波动隔离开。
二、关键洞察:长程任务本身有结构
信用分配也应该有
想象一个 ALFWorld 任务:把加热后的苹果放进冰箱。智能体正确地找到了苹果、拿起了苹果、完成了加热,只在最后的放置环节出了错。在 GRPO 看来,这条轨迹和从头错到尾的轨迹没有任何区别,每一步都被打上同样的负分。
但从任务本身看,这个目标可以自然拆成几个必经的子目标:找到苹果、加热苹果、放入冰箱。每完成一个,就离终点近了一步。
本文的核心想法就在这里:既然任务有这样的组合结构,信用分配就应该利用它。已经达成的子目标理应换来正向信用,而不是被后面的失败一票否决。
里程碑具体怎么定义?
这是很多读者关心的问题。BEACON 中的里程碑由一个指示函数 Φ 判定,它完全由环境给出,不需要训练任何额外的模型。三个环境的做法各不相同:
• ALFWorld:里程碑对应完成任务过程中必须经过的关键步骤。还是以加热苹果为例,拿到苹果、完成加热就是两个绕不开的节点,环境通过物体和状态谓词(比如某个物体是否已被持有、是否已处于加热状态)来判断这些步骤是否达成。
• WebShop:通过检查环境状态来判定购物进展。比如搜索结果里是否出现了符合目标描述的商品、进入商品页后尺寸颜色等属性是否选择正确、是否顺利走到下单确认页。每通过一个检查点,就算达成一个里程碑。
• ScienceWorld:环境自带 subgoal_completed 接口,子目标完成时直接给出信号,读取即可。
训练时,框架根据批次数据里的里程碑字段自动选择对应的处理方式,一套训练管线就能支持全部三个环境,不需要在训练器里写环境相关的分支代码。
三、方法:轨迹分段、段内奖励塑形
双尺度优势估计
![]()
图2. BEACON 整体框架。上半部分:在里程碑边界处切分轨迹,段内施加时间衰减奖励(衰减因子 γ);下半部分:结合轨迹级与段级信号的双尺度优势估计。
1. 轨迹分段(Trajectory Partitioning)
用上面定义的里程碑指示器 Φ 找出轨迹中每个子目标完成的时刻,在这些边界处把整条轨迹切成若干段。
2. 段内时间衰减奖励(Temporal Reward Shaping)
在每个完成的段内,动作获得形如 r = R · γ^(t_k − t) 的塑形奖励:离里程碑越近的动作拿到的正向信用越高,往前逐步递减,覆盖整个段。这样即便整条轨迹最终失败,已经达成的里程碑仍然能转化成有效的学习信号,部分成功不再被浪费。
3. 双尺度优势估计(Dual-Scale Advantage Estimation)
轨迹级优势沿用 GRPO 的做法,负责把握全局任务表现;段级优势则只在到达同一里程碑的轨迹之间比较,用来评价局部动作质量,后面段落的波动不会干扰前面动作的评估。两者线性组合:。
整个方法只引入两个超参数:段内奖励的衰减因子 γ 和段级优势的权重 λ,实现上简单直接。
四、实验:任务越长,领先越多 4.1 主实验
在 ALFWorld、ScienceWorld、WebShop 三个基准、1.5B 和 7B 两个模型规模上,BEACON 一致超过 GRPO 和 GiGPO。其中 ALFWorld 长程(Long)任务的成功率达到92.9%,GRPO 为53.5%。
![]()
图3. 主实验结果。BEACON 在三大基准、两个模型规模上全面领先。
4.2 样本效率:从 23.7% 到 82.0%
GRPO 训练中,大量部分成功的轨迹因为终局失败而贡献零信号。BEACON 把这些走到一半的轨迹全部转化为有效梯度,有效样本利用率从23.7% 提升到 82.0%,零优势比例(Zero-Advantage Ratio)从约 55% 降到约 10%。
![]()
图4. ALFWorld 训练过程中的轨迹分布。BEACON 将部分成功(橙色)转化为学习信号。
4.3 任务视野越长,优势越明显
另一个关键发现是,BEACON 相对 GRPO 的领先幅度随任务长度单调扩大:成功率的相对提升从短程任务的 +26.2% 扩大到长程任务的 +73.6%,而对比方法 GiGPO 在长程上明显趋于平台。这说明里程碑式的信用分配正好命中了长程 RL 的病根。
![]()
图5.(a)零优势比例对比;(b)相对增益随任务视野扩大,GiGPO 在长程上趋于平台。
五、深入分析:
收益来自策略优化,不是里程碑模仿
一个自然的质疑:效果会不会来自变相模仿里程碑轨迹?
作者做了一组干净的对照,直接用 oracle 轨迹做 SFT(行为克隆),结果只有 43%,而 BEACON 达到 91.4%。
收益明确来自策略优化本身。另外,尽管 BEACON 的信用集中率(CCR=0.84)在各方法中最低,性能却最好。保留渐进式的梯度信用,比激进地只奖励里程碑动作更有效。
![]()
图6.(a)信用集中度与性能的关系;(b)BEACON(91.4%)大幅超过 oracle 轨迹上的 SFT(43%)。
训练动态也更健康:BEACON 在第 50 个迭代就达到 60% 成功率,GRPO 要到第 120 个迭代才追平;策略熵平滑下降,说明一致的里程碑反馈带来的是稳定的逐步精炼,而不是突然的崩塌式收敛。
![]()
图7. 训练动态。BEACON 收敛速度约为 GRPO 的 2.4 倍,且策略熵下降更平稳。
逐动作的信用分配案例里,三种方法的差异也很直观:GRPO 给所有动作打同样的分;GiGPO 因为按状态分组,会出现反直觉的符号翻转;BEACON 则准确地奖励里程碑动作,惩罚错误和绕路。
![]()
图8. 逐动作信用分配案例对比。
六、总结与展望
BEACON 用一个简洁的思路回应了长程智能体训练的核心难题:任务有结构,信用分配就应该利用这个结构。
它不需要训练额外的奖励模型,不需要逐环境调参,只依赖环境本身可以验证的里程碑信号,就把只看终局的稀疏奖励,变成了对每个阶段性进展都有反馈的学习信号。
随着 Agentic LLM 走向更长的任务视野,比如多轮工具调用、跨应用工作流、长周期的科研助手,这种按里程碑分配信用的思路有希望成为长程智能体 RL 的通用做法。
团队已将完整训练代码(基于 verl-agent)开源,包含三个环境的一键复现脚本,欢迎试用与交流。
Illustration From IconScout By IconScout Store
9月28日晚@美国匹兹堡
「IROS 2026 群星闪耀 精英晚宴」
免费报名,期待线下见面!
北京时间9月25日(周五) 12:00截止报名
-The End-
本周上新!
扫码观看!
“AI技术流”原创投稿计划
TechBeat是由将门创投建立的AI学习社区(www.techbeat.net)。社区上线700+期talk视频,3000+篇技术干货文章,方向覆盖CV/NLP/ML/Robotis等;每月定期举办顶会及其他线上交流活动,不定期举办技术人线下聚会交流活动。我们正在努力成为AI人才喜爱的高质量、知识型交流平台,希望为AI人才打造更专业的服务和体验,加速并陪伴其成长。
投稿内容
// 最新技术解读/系统性知识分享 //
// 前沿资讯解说/心得经历讲述 //
投稿须知
稿件需要为原创文章,并标明作者信息。
我们会选择部分在深度技术解析及科研心得方向,对用户启发更大的文章,做原创性内容奖励
投稿方式
发送邮件到
yimingzhang@thejiangmen.com
或添加工作人员微信(aceyiming)投稿,沟通投稿详情
关于我“门”
将门是一家以专注于数智核心科技领域的新型创投机构,也是北京市标杆型孵化器。 公司致力于通过连接技术与商业,发掘和培育具有全球影响力的科技创新企业,推动企业创新发展与产业升级。
将门成立于2015年底,创始团队由微软创投在中国的创始团队原班人马构建而成,曾为微软优选和深度孵化了126家创新的技术型创业公司。
如果您是技术领域的初创企业,不仅想获得投资,还希望获得一系列持续性、有价值的投后服务,欢迎发送或者推荐项目给我“门”:
bp@thejiangmen.com
![]()
点击右上角,把文章分享到朋友圈
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.