网易首页 > 网易号 > 正文 申请入驻

Harness原生Agent新突破!微软发布OpenForge RL:在任意环境中端到端训练

0
分享至


在任意 Harness 中训练 Agent,为什么难以实现?

目前的难点在于,harness 推理通常是有状态、多进程的。主流开放 RL 框架默认本地 rollout,难以直接复用原始harness;如果训练阶段改用简化版 harness,交互流程则有可能偏离部署环境,导致训练和部署不匹配。

针对这个问题,来自微软和哥伦比亚大学的研究团队提出了 Harness 原生 Agent 端到端训练框架 OpenForge RL。它通过轻量级 Agent 记录模型调用,将调用记录转换为训练框架可用的数据,由 Kubernetes 编排器在独立容器中调度 rollout,从而在任何 harness 和环境中进行大规模训练。


论文链接:https://arxiv.org/abs/2607.21557

结果显示,经 OpenForge RL 训练的模型在几乎所有基准上均优于同等规模的开源模型,展现出更高的样本效率和更强的跨 harness 泛化能力。


图|左侧:OPENFORGE RL 构建在 Orchard Env上,并将任意 harness × 任意环境连接到 veRL 等标准 RL 代码库,不存在训练-部署不匹配。右侧:使用 OPENFORGE 训练得到的模型,在 6 种 harness 上,跨六个 Claw 和 GUI 环境进行评估。

然而,尽管强化学习(RL)提升了 Agent 在复杂工具调用和多步交互任务中的可靠性,但自我纠错能力仍是短板。

研究团队表示,这项工作旨在让研究人员能够在真实部署的 harness 和环境中训练并改进 Agent,从而降低研究门槛。

OpenForge RL:Harness原生Agent训练框架

OpenForge RL 是一个即插即用的 rollout 接口,用于把分布式 harness rollout 接入 veRL 等 RL 框架。它在 harness 与推理服务器之间加入 Agent,记录模型调用,并在 rollout 结束后重构为标准 RL 训练轨迹。由此,harness 代码无需修改,也能通过 Kubernetes 编排器扩展到数千个并发环境。

具体流程如下:

1.Agent:包装 vLLM 等推理服务器,记录 rollout 中的生成请求和模型回复;任务结束后,收集终止奖励,并将 prompt-response 记录重构为训练轨迹。GRPO 等基于组的算法则根据同组轨迹的平均奖励计算优势值。

2.Kubernetes 编排器:负责在 Azure 等云上创建、管理和回收 rollout 容器。每个容器拥有独立 CPU 和内存,并与训练节点分离运行,可支撑大规模并发 rollout。

为避免远程 rollout 无响应或失败影响训练,OPENFORGE RL 还采用了以下容错机制:

1.墙钟超时:为每个 rollout 任务设置时间上限。超过时间仍无响应时,OPENFORGE RL 会终止该任务并返回错误信号,让训练器可以继续从剩余 rollout 中收集数据。

2.异常 rollout 丢弃: 如果 rollout 因网络问题、任务故障或 harness 故障失败,OPENFORGE RL 不会为其分配奖励,而是直接丢弃该 rollout,避免引入误导性训练信号。


图|OPENFORGE RL 概览。

为支持在多样环境中开展 OpenForge RL 实验,研究团队还构建了一条简单的任务生成流水线,先生成指令、过滤任务,再构建 Docker 环境和验证脚本,并用开放 LLM/VLM 试跑并修补,直到通过端到端检查。环境可预装 OpenClaw、Codex 等 harness,生成任务可同时用于 SFT 和 RL。


图|数据/任务合成流水线的概览。

同规模领先,跨harness泛化更强

研究团队在工具使用(Claw)和多模态 GUI 两类长程任务上评估了 OpenForge RL。整体来看,OpenForge 训练的模型在几乎有基准上均优于同等规模的开源模型,并展现出更高的样本效率和更强的跨 harness泛化能力。

1. 基准测试表现

在 Claw 任务上,OpenForge-Claw 在多个基准上优于同规模模型,目前的任务环境能够为模型提供有效训练信号。相较于仅经过 SFT 训练的模型,经过 SFT+RL 训练的模型在鲁棒性和平均成功率上均有提升。


图|Claw Agent 在 Claw-Eval、QwenClawBench 和 MCPAtlas 上的表现。

在 GUI 任务上,OpenForge-GUI 也表现出较强竞争力。相比使用 20 万+ 任务训练的 MolmoWeb,OpenForge-GUI 只用 2.5k 个任务,就在 Online-Mind2Web 上超过前者,并在 WebVoyager 上保持竞争力;OpenForge-GUI 优于相近规模的开放基线,并在 GUI 设置中追平或超过数倍更大的模型;经过 SFT+RL 训练后,其在 3 个基准上也均优于仅 SFT 版本。


图|GUI Agent 在 OSWorld-Verified、OnlineMind2Web 和 WebVoyager 上的表现。

2.跨 Harness 泛化能力

研究团队进一步考察了模型在不同 harness 下的泛化表现。结果显示,单一 harness 训练已有一定迁移能力,多 harness 联合训练整体更优,且在复杂 harness 上的收益更明显。

不同 harness 的学习难度存在显著差异。在 ClawEval 中,研究团队使用 ReACT、ZeroClaw、OpenClaw 和 Codex 等 harness 进行评估。结果显示,工具接入更灵活的 harness 得分最高。SFT+RL 能提升大多数 harness 的表现,但在 OpenClaw 上带来的提升相对有限,这可能与其更长的 prompt、更复杂的上下文有关。

多 harness 联合训练整体更优。例如,ZeroClaw 上的分数从 46.0 提高到 48.5。研究团队认为,这可能与多 harness 训练引入的工具调用方式和控制流程多样性有关。


图|在不同 harness 下比较 OpenForge-Claw 在 ClawEval 上的表现。

未见 harness 评估中,单 harness 训练表现出一定迁移能力。例如,仅在 ZeroClaw 上训练的模型,在未参与训练的 OpenClaw 和 Codex 上也有提升。相比之下,多 harness 联合训练的整体表现更好,更丰富的工具调用方式和控制流程可能有助于提升泛化能力。


图|未见 harness 评估。

3.RL 学到的能力

RL 使模型更少依赖通用 shell,更倾向于选择合适的专用工具。在 ZeroClaw harness 下,通用 shell 调用占比从 22.6% 降至 13.9%,调用相应转向专用服务工具,轨迹长度也略有缩短。

RL 还提升了多项 Agent 的可靠性指标。在 Codex harness 下,模型的自我验证、工具覆盖率和格式鲁棒性都有所提升。


图|SFT 与 SFT+RL 在 ClawEval 上的行为比较。

不足和未来发展

尽管 OpenForge RL 在基准测试和跨 harness 泛化实验中取得了不错的结果,但依然存在以下几点不足:

首先,异常 rollout 的处理仍较为保守。运行 rollout 任务的容器可能因网络错误、harness 崩溃或超时而中断。未来,研究团队将进一步研究部分 rollout 的信用分配,让有效交互步骤能够被用于训练。

其次,错误恢复能力仍然不足。RL 能提升自我验证、工具覆盖和多步计划等能力,但错误恢复在 RL 后仍是较弱项。因此,后续研究将针对错误恢复构建专门数据,并探索相应训练方法,以进一步强化这类能力。

此外,数据和基础设施仍是扩展到更多agent环境的门槛。未来,研究团队表示将公开代码、数据集和模型,希望降低在真实 harness 和环境中训练 Agent 的门槛。

作者:夏千斯

如需转载或投稿,请直接在本文章评论区内留言

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
年薪百万是一种什么感觉?网友:其实阿姨过的才是我想要的人生!

年薪百万是一种什么感觉?网友:其实阿姨过的才是我想要的人生!

另子维爱读史
2026-10-04 21:20:22
刘思齐晚年坦白:毛岸英入朝之前,曾反复问过毛主席一个问题!

刘思齐晚年坦白:毛岸英入朝之前,曾反复问过毛主席一个问题!

凡人侃史
2026-10-04 17:37:32
大家提前做好准备,不出意外的话,10月开始中国或将出现4大转变

大家提前做好准备,不出意外的话,10月开始中国或将出现4大转变

梦回千年aa
2026-10-04 09:38:11
比媒:拉门斯3场证明自己值得信任,简直是居莱尔的噩梦

比媒:拉门斯3场证明自己值得信任,简直是居莱尔的噩梦

懂球帝
2026-10-04 17:17:09
无解的僵局!拉夫罗夫悲观直言,觉得有生之年不会见到俄西和解了

无解的僵局!拉夫罗夫悲观直言,觉得有生之年不会见到俄西和解了

旧史新谭
2026-09-10 21:43:57
U18亚洲杯-中国女篮狂胜马来西亚86分 孙晗昀22+8引6人上双

U18亚洲杯-中国女篮狂胜马来西亚86分 孙晗昀22+8引6人上双

醉卧浮生
2026-10-04 20:56:29
芬兰主帅拿C罗风波开玩笑,记者集体沉默

芬兰主帅拿C罗风波开玩笑,记者集体沉默

懂球帝
2026-10-04 10:57:20
比亚迪为什么能重构出行生态格局?

比亚迪为什么能重构出行生态格局?

小眼睛小世界
2026-10-04 04:28:28
今天是10月4日,国庆假期第四天。关于2026年退休人员基本养老金调整,有4个“没想到”。

今天是10月4日,国庆假期第四天。关于2026年退休人员基本养老金调整,有4个“没想到”。

骑驴追光者
2026-10-04 11:14:41
马斯克断崖式分手4娃高管!公开私信戳破试管生育传闻

马斯克断崖式分手4娃高管!公开私信戳破试管生育传闻

魏家东
2026-10-03 15:25:35
逼迫空姐下跪的男子身份疑似被扒!全网炸锅:难怪他这么嚣张啊

逼迫空姐下跪的男子身份疑似被扒!全网炸锅:难怪他这么嚣张啊

胡侃社会百态
2026-10-05 00:05:17
因产生分歧 美国反华议员科顿被特朗普“开盒”

因产生分歧 美国反华议员科顿被特朗普“开盒”

看看新闻Knews
2026-10-04 23:35:41
财政部发布重要消息,2026年养老金调整现在确定好了没?

财政部发布重要消息,2026年养老金调整现在确定好了没?

余塩搞笑段子
2026-10-04 21:23:49
詹姆斯首秀惊艳!76人,赢麻了……

詹姆斯首秀惊艳!76人,赢麻了……

体育新角度
2026-10-04 21:20:48
龙芯都那么强,只落后intel两年了,为何大家死活不愿意用?

龙芯都那么强,只落后intel两年了,为何大家死活不愿意用?

互联网.乱侃秀
2026-10-03 11:30:53
郑钦文主场怒斥观众喧哗,自曝:我的情绪不太稳定

郑钦文主场怒斥观众喧哗,自曝:我的情绪不太稳定

体育妞世界
2026-10-04 08:15:00
越想越怕!上海33岁老师泰国失联,知情人爆更多细节,老母亲崩溃

越想越怕!上海33岁老师泰国失联,知情人爆更多细节,老母亲崩溃

阳春三月天晴
2026-10-04 17:46:05
扫黑除恶 | 辽宁省公安厅公布5起新型恶势力犯罪典型案例

扫黑除恶 | 辽宁省公安厅公布5起新型恶势力犯罪典型案例

新浪财经
2026-10-04 18:18:06
国安部披露:有境外组织以“旅游”“科考”为名,深入我国生态敏感区,或借“医疗检测”非法采集人血样,窃取我国基因资源与研究数据

国安部披露:有境外组织以“旅游”“科考”为名,深入我国生态敏感区,或借“医疗检测”非法采集人血样,窃取我国基因资源与研究数据

每日经济新闻
2026-10-04 17:10:59
一个人如果舍不得扔旧衣服,说明他的命运,大概率会是这两种结果

一个人如果舍不得扔旧衣服,说明他的命运,大概率会是这两种结果

风起见你
2026-09-28 01:22:36
2026-10-05 03:47:00
学术头条
学术头条
致力于学术传播和科学普及,重点关注AI4Science、大模型等前沿科学进展。
1487文章数 5081关注度
往期回顾 全部

科技要闻

苹果确认:iPhone 18 Pro Max有问题

头条要闻

30多岁中国夫妇在澳洲遇惨烈车祸丧生 肇事司机仅17岁

头条要闻

30多岁中国夫妇在澳洲遇惨烈车祸丧生 肇事司机仅17岁

体育要闻

32胜0负!德约2-1逆转头号种子兹维列夫 第7次晋级中网四强

娱乐要闻

高晓松悄悄复出:官媒没给他留体面

财经要闻

OpenAI前安全部门员工:公司文化已崩坏

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

健康
教育
数码
游戏
手机

刷酸祛痘,为什么有人翻车?

教育要闻

一年级只招1人,大批学校撤并,农村小学还有未来吗?

数码要闻

联想推出Lenovo Watch Fit 3智能手表,199元

《战争机器》新作恐怖感拉满!怪物直扑玩家脸

手机要闻

iPhone18 Pro:首销破百万,国产旗舰首销总和不到人一半!

无障碍浏览 进入关怀版