网易首页 > 网易号 > 正文 申请入驻

OpenAI o1核心成员跳槽,首次公开397B模型的RL训练配方!

0
分享至

智猩猩AI整理

编辑: 没方

昨晚,LoRA 一作、前 OpenAI 研究员 Edward Hu在 X 上宣布,自己已经加入Mercor,负责模型训练与研究。

而他加入后的首批公开工作,就是把一套397B 参数开放模型的 Agent 强化学习训练配方完整摊了出来

从训练方法、工程细节到最终结果,团队不仅详细拆解了整个 RL 过程,还一并开源了训练脚本、模型权重以及评测 traces。


01

他是LoRA的一作,还参与

做出了OpenAI o1模型

Edward Hu 本科毕业于约翰·霍普金斯大学,之后前往 Mila 攻读计算机博士,导师是图灵奖得主Yoshua Bengio


他是LoRA 的第一作者

LoRA(Low-Rank Adaptation)是大模型参数高效微调最常见的方法之一。它冻结原模型参数,只训练额外加入的低秩矩阵,从而大幅降低大模型微调需要训练的参数量和显存。


2023 年,Edward Hu 暂停博士学业加入 OpenAI,参与构建o1模型,之后返回完成博士论文。


如今,他已经加入 Mercor,担任Head of AI Modeling


从 LoRA 到 OpenAI o1,再到如今的大规模强化学习,Edward Hu 的研究都是围绕“如何更高效地训练模型,并进一步提升模型的推理和学习能力”。

那为什么他的下一站会是 Mercor?

Edward Hu 在 X 上宣布加入 Mercor 时给出了自己的判断:随着前沿模型继续发展,高质量数据正成为模型完成高经济价值知识工作的关键瓶颈,而真正优质的数据,又必须和优秀的模型训练能力结合起来。

Mercor 恰好处在这两者的交汇点。

这家公司最早以 AI 人才匹配业务起家,由此积累了大量专业领域的人才与专家网络。近两年,Mercor 又组建了前沿研究团队 Mercor Research,开始将专家资源进一步转化为模型训练所需的高质量数据,并直接参与模型后训练和强化学习研究。

而 Edward Hu 加入后的第一项公开成果,正是沿着这条路线展开。

02

397B 模型的 RL

训练配方

这份指南来自 Mercor Research 与 SkyRL 团队的合作。

先看最终结果,在 Mercor 的 APEX-Agents 基准上,Qwen3.5-397B-A17B 的 Pass@1 从 16.11% 提升到 27.29%,相对提升约 70%;更小的 Qwen3.6-35B-A3B 经过 RL 后训练后,也在这一基准上超过了 Claude Opus 4.5。


相比已经被大量研究反复优化的 Coding Agent,专业知识工作是一个更难构造训练环境、同时也更加接近真实经济价值的场景。

这正是 Mercor 想切入的方向。

APEX-Agents 本身是一套包含 480 个公开测试任务的知识工作 Benchmark,覆盖管理咨询、投资银行和企业法务等领域。

与普通 Prompt Benchmark 不同,每个任务都存在于一个模拟企业环境中,里面包含大量 PDF、电子表格、Slides、聊天记录和邮件。Agent 必须通过 MCP 工具或者代码真正进入这个环境完成任务。

为了进行这次 RL 后训练,Mercor 又准备了 1928 个由专家创建的训练任务。它们与 APEX-Agents Benchmark 具有相同结构,但 Prompt 和模拟企业环境并不重合,以避免测试集污染。

而这篇指南最有意思的地方,就是团队把一次 397B Agentic RL 真正容易踩的坑几乎全部拆开讲了一遍。

(1)Harness等于练一个 epoch

在投入真正昂贵的 GPU 计算之前,首先必须把 Environment、Agent Harness 和 Token Accounting 搞对。

假设一个 Agent 工作了几十分钟,读完文档、打开 Excel、调用十几个工具,最后却因为 MCP 服务断开、Sandbox 超时或者 Tool 返回格式出错而得到 0 Reward。

对于普通 Agent 来说只是一次失败。放到 RL 里,却意味着几十万 Token 的 Rollout 和大量 GPU 时间直接被浪费,更麻烦的是,这些系统错误还可能反过来污染训练信号。

所以团队在真正训练之前,对整个 Harness 做了大量修补。

比如给文件下载、MCP 调用、容器关闭全部设置 Timeout;每个 Agent Loop 使用独立进程,避免大量并发 MCP 连接互相干扰;修复 PowerPoint Tool 成功执行后仍返回None的问题;PDF 多栏表格读取错误时,引导 Agent 改用pdfplumber

实验结果表明,仅优化 Harness 没有做任何训练,Qwen3.6-35B-A3B 的 Mean Reward 就从 22.74% 上涨到 28.69%。团队表示,这个提升幅度大约相当于在原 Harness 上训练完整一个 Epoch


另一个重点则是TITO(Token-In-Token-Out)

长程 Agent 会经历大量交互。如果模型输出先转成文本,再由 Harness 重新 Tokenize,得到的 Token ID 可能与 Rollout 时并不一致,导致 Trainer 实际训练在模型从未采样过的 Token 序列上,使 RL 悄悄Off-policy

团队选择保留模型实际生成的 Token ID,避免反复 decode → re-tokenize,从而减少 Rollout 与 Trainer 之间的 Token 偏差,让 Agent Harness 更适合强化学习训练。

(2)35B 先试错,再把配方放大到 397B

解决系统问题之后,团队只取32 个任务,检查模型能不能迅速把它们学会。如果连 32 个任务都过拟合不了,直接跑一次大规模实验,基本就是白烧 GPU了。

而这一步还真的发现了问题。

团队发现,那些依赖 rollout 前后文件差异进行评分的任务,明显比只看最终回答的任务更难学。顺着这个现象检查后,他们发现问题出在 Grader 的文件比较逻辑上。在换用第三方 File Diff 工具、提高文件提取和比较的准确性后,这些任务才开始表现出清晰的学习信号。

确认整个 Pipeline 没问题后,他们先用 35B 模型做各种算法消融实验。

其中一个非常重要的发现是,长程 Agent RL 如果直接按所有 Token 做全局平均,长轨迹会天然主导梯度。

因此,团队改用 prompt_mean,让不同 rollout group 先获得相同权重,再在每组内部平均 Token Loss。这一项改动,就让结果增加了3.9 个百分点

另外一个技巧是,当 Agent 已经消耗掉 80% Context 时,Harness 会提醒一句“该收尾了

这个 Context Nudge 能减少 Agent 因 Context 爆掉而整个 Rollout 得到零分的情况,仅训练阶段加入这一机制,增加了3.0 个点

最终团队确定的组合是:DPPO + prompt_mean + Context Nudge


随后才启动397B 模型训练

(3)397B 的 Agentic RL 到底怎么跑起来?

Agentic RL 中,一部分 GPU 要负责 Rollout,让模型进入环境跑任务。另一部分 GPU 则负责 Trainer,根据 Reward 更新参数。

如果 Rollout 太慢,Trainer 就得等数据。如果训练太慢,大量生成出来的 Trajectory 又会因为 Policy 已经更新而变得过旧。


如下图所示,团队采用SkyRL + vLLM + Megatron构建 Fully Async RL 训练栈,并基于 Ray 调度分布式任务。每个 Agent Trial 则由 Harbor 管理独立沙箱环境。


团队在 35B 实验中将推理与训练节点比例设置为4:2,到了 397B 则扩展为12:8。与此同时,35B 模型最多同时运行约550 条 Rollout,397B 模型则设置为300 条并发 Rollout

为什么模型更大,并发反而下降?

瓶颈之一就是KV Cache。这些任务一次 Trajectory 动辄数万乃至十几万 Token,单个 Agent 占用的 KV Cache 非常大,因此真实系统能够承载多少并发 Agent,很快会被显存限制。

可以看出,大规模 Agentic RL 到最后已经不只是一个“选什么 RL 算法”的问题。它同时是一个分布式训练、推理吞吐、KV Cache、Agent Runtime 和环境基础设施问题

(4)换掉 Harness,RL 增益还在

RL 训练还有一个问题:模型学到的能力,会不会绑定在训练时使用的 Agent Harness 上?

团队专门测试了这一点。训练时,模型使用基于 MCP 的 Archipelago Harness;评测时则完全换成代码型 OpenCode,不再提供任何 MCP Server,只开放 bash、grep、read、write、edit 等代码和文件工具。

结果显示,RL 带来的大部分性能增益仍然能够跨 Harness 保留下来

团队进一步把任务也换掉,在从未用于 RL 训练的 Terminal-Bench 2.1 上评测,模型同样获得提升。这说明模型学到的不只是 APEX-Agents 或 Archipelago 的固定工作流,而具有一定的跨 Harness、跨任务泛化能力。


与此同时,团队在 HLE 和 GPQA 上也没有观察到明显退化,说明 Agent 能力提升并未以牺牲通用推理能力为代价。


03

算法选择的重要性,

可能没有数据本身那么大

团队比较了五类算法和训练技巧后发现,效果最好的单项改动,也只带来了 3.9 个点的提升。但整套 Post-training 做完后,两个模型都提高了大约 10~12 个百分点。

因此,Edward Hu 团队给出了两个很明确的判断。

首先,算法选择的重要性,可能没有数据本身那么大。

Coding Agent 之所以率先跑通 RL,很大程度上就是因为代码天然拥有大量可执行、可验证的数据。如果 AI 要真正接管咨询、金融、法律、科研这些知识工作,真正稀缺的是把真实工作拆成环境、任务、工具、轨迹和可靠 Reward 的高质量数据。

其次,这些 RL 增益并没有被锁死在某一个 Agent Harness 里

一个经过 Post-training 的开源模型,更像是一个可以复用的能力资产,而不是“焊死”在某套 Agent Scaffold 上的专用模型。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
美国银行32岁副总裁遇刺身亡,刚结束产假恢复工作,凶手哥哥:妹妹有3个女儿,是心理学硕士,患有产后抑郁和双相情感障碍

美国银行32岁副总裁遇刺身亡,刚结束产假恢复工作,凶手哥哥:妹妹有3个女儿,是心理学硕士,患有产后抑郁和双相情感障碍

大风新闻
2026-09-02 17:10:04
尼泊尔用无人机搜救幸存者,播放歌曲等回应,隧道被泥浆“像牙膏一样”塞满

尼泊尔用无人机搜救幸存者,播放歌曲等回应,隧道被泥浆“像牙膏一样”塞满

红星新闻
2026-09-02 16:23:27
15岁继位的泰国国王拉玛五世,娶4位同父异母的亲妹妹生下77个孩子,用42年改革使泰国成为东南亚唯一没有沦为殖民地的国家

15岁继位的泰国国王拉玛五世,娶4位同父异母的亲妹妹生下77个孩子,用42年改革使泰国成为东南亚唯一没有沦为殖民地的国家

磊子讲史
2026-08-01 18:54:59
女篮核心李月汝护照丢失无缘世界杯!宫鲁鸣妙计落空,三座大山是否会压垮中国队?

女篮核心李月汝护照丢失无缘世界杯!宫鲁鸣妙计落空,三座大山是否会压垮中国队?

眼界纵横
2026-09-03 00:57:18
张元英姐姐晒照上热搜,颜值不输妹妹,网友:基因太强了

张元英姐姐晒照上热搜,颜值不输妹妹,网友:基因太强了

影视情报室
2026-09-02 16:33:42
深圳市人大常委会原秘书长汤暑葵辞去市人大代表职务

深圳市人大常委会原秘书长汤暑葵辞去市人大代表职务

叮当当科技
2026-09-03 01:22:28
强盗本性爆发,美欧合力逼人民币升值,要让14亿中国人给美债买单

强盗本性爆发,美欧合力逼人民币升值,要让14亿中国人给美债买单

玲儿爱唱歌
2026-09-02 22:26:56
杨瀚森翻译:开拓者队已经通知我,后续不会雇我随队,杨瀚森表态

杨瀚森翻译:开拓者队已经通知我,后续不会雇我随队,杨瀚森表态

他是她的岛熊
2026-05-29 14:53:58
必须警惕,值得反省!中国抓捕大量间谍,

必须警惕,值得反省!中国抓捕大量间谍,

乌克兰小静
2026-09-01 02:52:11
浙大研究发现:最伤眼睛行为,不是看手机!而是频繁去做这8件事

浙大研究发现:最伤眼睛行为,不是看手机!而是频繁去做这8件事

任医生聊健康
2026-09-01 19:50:06
美俄再次讨论俄乌停火计划,克宫要求乌克兰移交顿巴斯

美俄再次讨论俄乌停火计划,克宫要求乌克兰移交顿巴斯

山河路口
2026-09-01 13:35:37
事闹大了!伊朗总统还在上合峰会开会,亲儿子要被革命卫队定罪了

事闹大了!伊朗总统还在上合峰会开会,亲儿子要被革命卫队定罪了

顾秋韵
2026-09-02 15:22:47
当场挑明!伊朗总统在上合峰会对中俄交底:别指望我们无限忍耐

当场挑明!伊朗总统在上合峰会对中俄交底:别指望我们无限忍耐

老慃尾声体育解说
2026-09-03 01:24:38
千百年来我国民间一直使用腐熟粪肥浇灌蔬菜,这门传统农耕手段,为何近些年才被欧洲科研机构证实价值?

千百年来我国民间一直使用腐熟粪肥浇灌蔬菜,这门传统农耕手段,为何近些年才被欧洲科研机构证实价值?

唠叨说历史
2026-08-26 16:08:48
9月2日喜鹊报喜,属蛇的:有一件大喜事上门!

9月2日喜鹊报喜,属蛇的:有一件大喜事上门!

刺头体育
2026-09-02 07:29:14
舟山迎来重大契机!定海片区升级,海岛城市发展格局迎来重构

舟山迎来重大契机!定海片区升级,海岛城市发展格局迎来重构

黑哥讲现代史
2026-09-03 01:32:19
贝森特没眼力见仍对华施压,俄方抛了个重磅提议,说到特朗普心坎

贝森特没眼力见仍对华施压,俄方抛了个重磅提议,说到特朗普心坎

邱震海
2026-09-02 18:23:01
晴天霹雳!中国女篮1主力球员意外受伤,让人担忧

晴天霹雳!中国女篮1主力球员意外受伤,让人担忧

体育哲人
2026-09-02 13:56:37
没料到!勒庞决选通杀,亲华派跌剩2%支持率,法国恐怕要大变天

没料到!勒庞决选通杀,亲华派跌剩2%支持率,法国恐怕要大变天

共工之锚
2026-09-02 00:23:56
印度的惨状,给中美俄都提了个醒:哪怕是大国,也一步都不能走错

印度的惨状,给中美俄都提了个醒:哪怕是大国,也一步都不能走错

小莜读史
2026-09-01 12:48:26
2026-09-03 03:56:49
智猩猩
智猩猩
AI 技术内容与服务平台
52文章数 2关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

游客拍下疑冰崩画面:土石翻涌 山间有黑色物体涌出

头条要闻

游客拍下疑冰崩画面:土石翻涌 山间有黑色物体涌出

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

星宇股份的麻烦,才刚开始

汽车要闻

配双腔空悬+机械差速锁 传祺越7预售权益价17.18万起

态度原创

时尚
教育
亲子
家居
健康

白衬衫不火了?早秋穿“棕色衬衫”更高级好看

教育要闻

一学期只能紧急上一次厕所!县中越卷越离谱,学生憋尿能上清北?

亲子要闻

为啥老人一定要给儿子带小孩儿!网友:这是看到过的很正确的解释

家居要闻

2026建博会(广州) 公装联探展交流活动

越吃越爆痘?医生讲清7大真相

无障碍浏览 进入关怀版