智猩猩AI整理
编辑: 没方
昨晚,LoRA 一作、前 OpenAI 研究员 Edward Hu在 X 上宣布,自己已经加入Mercor,负责模型训练与研究。
而他加入后的首批公开工作,就是把一套397B 参数开放模型的 Agent 强化学习训练配方完整摊了出来。
从训练方法、工程细节到最终结果,团队不仅详细拆解了整个 RL 过程,还一并开源了训练脚本、模型权重以及评测 traces。
![]()
01
他是LoRA的一作,还参与
做出了OpenAI o1模型
Edward Hu 本科毕业于约翰·霍普金斯大学,之后前往 Mila 攻读计算机博士,导师是图灵奖得主Yoshua Bengio。
![]()
他是LoRA 的第一作者。
LoRA(Low-Rank Adaptation)是大模型参数高效微调最常见的方法之一。它冻结原模型参数,只训练额外加入的低秩矩阵,从而大幅降低大模型微调需要训练的参数量和显存。
![]()
2023 年,Edward Hu 暂停博士学业加入 OpenAI,参与构建o1模型,之后返回完成博士论文。
![]()
如今,他已经加入 Mercor,担任Head of AI Modeling。
![]()
从 LoRA 到 OpenAI o1,再到如今的大规模强化学习,Edward Hu 的研究都是围绕“如何更高效地训练模型,并进一步提升模型的推理和学习能力”。
那为什么他的下一站会是 Mercor?
Edward Hu 在 X 上宣布加入 Mercor 时给出了自己的判断:随着前沿模型继续发展,高质量数据正成为模型完成高经济价值知识工作的关键瓶颈,而真正优质的数据,又必须和优秀的模型训练能力结合起来。
Mercor 恰好处在这两者的交汇点。
这家公司最早以 AI 人才匹配业务起家,由此积累了大量专业领域的人才与专家网络。近两年,Mercor 又组建了前沿研究团队 Mercor Research,开始将专家资源进一步转化为模型训练所需的高质量数据,并直接参与模型后训练和强化学习研究。
而 Edward Hu 加入后的第一项公开成果,正是沿着这条路线展开。
02
397B 模型的 RL
训练配方
这份指南来自 Mercor Research 与 SkyRL 团队的合作。
先看最终结果,在 Mercor 的 APEX-Agents 基准上,Qwen3.5-397B-A17B 的 Pass@1 从 16.11% 提升到 27.29%,相对提升约 70%;更小的 Qwen3.6-35B-A3B 经过 RL 后训练后,也在这一基准上超过了 Claude Opus 4.5。
![]()
相比已经被大量研究反复优化的 Coding Agent,专业知识工作是一个更难构造训练环境、同时也更加接近真实经济价值的场景。
这正是 Mercor 想切入的方向。
APEX-Agents 本身是一套包含 480 个公开测试任务的知识工作 Benchmark,覆盖管理咨询、投资银行和企业法务等领域。
与普通 Prompt Benchmark 不同,每个任务都存在于一个模拟企业环境中,里面包含大量 PDF、电子表格、Slides、聊天记录和邮件。Agent 必须通过 MCP 工具或者代码真正进入这个环境完成任务。
为了进行这次 RL 后训练,Mercor 又准备了 1928 个由专家创建的训练任务。它们与 APEX-Agents Benchmark 具有相同结构,但 Prompt 和模拟企业环境并不重合,以避免测试集污染。
而这篇指南最有意思的地方,就是团队把一次 397B Agentic RL 真正容易踩的坑几乎全部拆开讲了一遍。
(1)修Harness等于练一个 epoch
在投入真正昂贵的 GPU 计算之前,首先必须把 Environment、Agent Harness 和 Token Accounting 搞对。
假设一个 Agent 工作了几十分钟,读完文档、打开 Excel、调用十几个工具,最后却因为 MCP 服务断开、Sandbox 超时或者 Tool 返回格式出错而得到 0 Reward。
对于普通 Agent 来说只是一次失败。放到 RL 里,却意味着几十万 Token 的 Rollout 和大量 GPU 时间直接被浪费,更麻烦的是,这些系统错误还可能反过来污染训练信号。
所以团队在真正训练之前,对整个 Harness 做了大量修补。
比如给文件下载、MCP 调用、容器关闭全部设置 Timeout;每个 Agent Loop 使用独立进程,避免大量并发 MCP 连接互相干扰;修复 PowerPoint Tool 成功执行后仍返回None的问题;PDF 多栏表格读取错误时,引导 Agent 改用pdfplumber。
实验结果表明,仅优化 Harness 没有做任何训练,Qwen3.6-35B-A3B 的 Mean Reward 就从 22.74% 上涨到 28.69%。团队表示,这个提升幅度大约相当于在原 Harness 上训练完整一个 Epoch。
![]()
另一个重点则是TITO(Token-In-Token-Out)。
长程 Agent 会经历大量交互。如果模型输出先转成文本,再由 Harness 重新 Tokenize,得到的 Token ID 可能与 Rollout 时并不一致,导致 Trainer 实际训练在模型从未采样过的 Token 序列上,使 RL 悄悄Off-policy。
团队选择保留模型实际生成的 Token ID,避免反复 decode → re-tokenize,从而减少 Rollout 与 Trainer 之间的 Token 偏差,让 Agent Harness 更适合强化学习训练。
(2)35B 先试错,再把配方放大到 397B
解决系统问题之后,团队只取32 个任务,检查模型能不能迅速把它们学会。如果连 32 个任务都过拟合不了,直接跑一次大规模实验,基本就是白烧 GPU了。
而这一步还真的发现了问题。
团队发现,那些依赖 rollout 前后文件差异进行评分的任务,明显比只看最终回答的任务更难学。顺着这个现象检查后,他们发现问题出在 Grader 的文件比较逻辑上。在换用第三方 File Diff 工具、提高文件提取和比较的准确性后,这些任务才开始表现出清晰的学习信号。
确认整个 Pipeline 没问题后,他们先用 35B 模型做各种算法消融实验。
其中一个非常重要的发现是,长程 Agent RL 如果直接按所有 Token 做全局平均,长轨迹会天然主导梯度。
因此,团队改用 prompt_mean,让不同 rollout group 先获得相同权重,再在每组内部平均 Token Loss。这一项改动,就让结果增加了3.9 个百分点。
另外一个技巧是,当 Agent 已经消耗掉 80% Context 时,Harness 会提醒一句“该收尾了”。
这个 Context Nudge 能减少 Agent 因 Context 爆掉而整个 Rollout 得到零分的情况,仅训练阶段加入这一机制,增加了3.0 个点。
最终团队确定的组合是:DPPO + prompt_mean + Context Nudge。
![]()
随后才启动397B 模型训练。
(3)397B 的 Agentic RL 到底怎么跑起来?
Agentic RL 中,一部分 GPU 要负责 Rollout,让模型进入环境跑任务。另一部分 GPU 则负责 Trainer,根据 Reward 更新参数。
如果 Rollout 太慢,Trainer 就得等数据。如果训练太慢,大量生成出来的 Trajectory 又会因为 Policy 已经更新而变得过旧。
如下图所示,团队采用SkyRL + vLLM + Megatron构建 Fully Async RL 训练栈,并基于 Ray 调度分布式任务。每个 Agent Trial 则由 Harbor 管理独立沙箱环境。
![]()
团队在 35B 实验中将推理与训练节点比例设置为4:2,到了 397B 则扩展为12:8。与此同时,35B 模型最多同时运行约550 条 Rollout,397B 模型则设置为300 条并发 Rollout。
为什么模型更大,并发反而下降?
瓶颈之一就是KV Cache。这些任务一次 Trajectory 动辄数万乃至十几万 Token,单个 Agent 占用的 KV Cache 非常大,因此真实系统能够承载多少并发 Agent,很快会被显存限制。
可以看出,大规模 Agentic RL 到最后已经不只是一个“选什么 RL 算法”的问题。它同时是一个分布式训练、推理吞吐、KV Cache、Agent Runtime 和环境基础设施问题。
(4)换掉 Harness,RL 增益还在
RL 训练还有一个问题:模型学到的能力,会不会绑定在训练时使用的 Agent Harness 上?
团队专门测试了这一点。训练时,模型使用基于 MCP 的 Archipelago Harness;评测时则完全换成代码型 OpenCode,不再提供任何 MCP Server,只开放 bash、grep、read、write、edit 等代码和文件工具。
结果显示,RL 带来的大部分性能增益仍然能够跨 Harness 保留下来。
团队进一步把任务也换掉,在从未用于 RL 训练的 Terminal-Bench 2.1 上评测,模型同样获得提升。这说明模型学到的不只是 APEX-Agents 或 Archipelago 的固定工作流,而具有一定的跨 Harness、跨任务泛化能力。
![]()
与此同时,团队在 HLE 和 GPQA 上也没有观察到明显退化,说明 Agent 能力提升并未以牺牲通用推理能力为代价。
![]()
03
算法选择的重要性,
可能没有数据本身那么大
团队比较了五类算法和训练技巧后发现,效果最好的单项改动,也只带来了 3.9 个点的提升。但整套 Post-training 做完后,两个模型都提高了大约 10~12 个百分点。
因此,Edward Hu 团队给出了两个很明确的判断。
首先,算法选择的重要性,可能没有数据本身那么大。
Coding Agent 之所以率先跑通 RL,很大程度上就是因为代码天然拥有大量可执行、可验证的数据。如果 AI 要真正接管咨询、金融、法律、科研这些知识工作,真正稀缺的是把真实工作拆成环境、任务、工具、轨迹和可靠 Reward 的高质量数据。
其次,这些 RL 增益并没有被锁死在某一个 Agent Harness 里。
一个经过 Post-training 的开源模型,更像是一个可以复用的能力资产,而不是“焊死”在某套 Agent Scaffold 上的专用模型。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.