网易首页 > 网易号 > 正文 申请入驻

Harness原生Agent新突破!微软发布OpenForge RL:在任意环境中端到端训练

0
分享至


在任意 Harness 中训练 Agent,为什么难以实现?

目前的难点在于,harness 推理通常是有状态、多进程的。主流开放 RL 框架默认本地 rollout,难以直接复用原始harness;如果训练阶段改用简化版 harness,交互流程则有可能偏离部署环境,导致训练和部署不匹配。

针对这个问题,来自微软和哥伦比亚大学的研究团队提出了 Harness 原生 Agent 端到端训练框架 OpenForge RL。它通过轻量级 Agent 记录模型调用,将调用记录转换为训练框架可用的数据,由 Kubernetes 编排器在独立容器中调度 rollout,从而在任何 harness 和环境中进行大规模训练。


论文链接:https://arxiv.org/abs/2607.21557

结果显示,经 OpenForge RL 训练的模型在几乎所有基准上均优于同等规模的开源模型,展现出更高的样本效率和更强的跨 harness 泛化能力。


图|左侧:OPENFORGE RL 构建在 Orchard Env上,并将任意 harness × 任意环境连接到 veRL 等标准 RL 代码库,不存在训练-部署不匹配。右侧:使用 OPENFORGE 训练得到的模型,在 6 种 harness 上,跨六个 Claw 和 GUI 环境进行评估。

然而,尽管强化学习(RL)提升了 Agent 在复杂工具调用和多步交互任务中的可靠性,但自我纠错能力仍是短板。

研究团队表示,这项工作旨在让研究人员能够在真实部署的 harness 和环境中训练并改进 Agent,从而降低研究门槛。

OpenForge RL:Harness原生Agent训练框架

OpenForge RL 是一个即插即用的 rollout 接口,用于把分布式 harness rollout 接入 veRL 等 RL 框架。它在 harness 与推理服务器之间加入 Agent,记录模型调用,并在 rollout 结束后重构为标准 RL 训练轨迹。由此,harness 代码无需修改,也能通过 Kubernetes 编排器扩展到数千个并发环境。

具体流程如下:

1.Agent:包装 vLLM 等推理服务器,记录 rollout 中的生成请求和模型回复;任务结束后,收集终止奖励,并将 prompt-response 记录重构为训练轨迹。GRPO 等基于组的算法则根据同组轨迹的平均奖励计算优势值。

2.Kubernetes 编排器:负责在 Azure 等云上创建、管理和回收 rollout 容器。每个容器拥有独立 CPU 和内存,并与训练节点分离运行,可支撑大规模并发 rollout。

为避免远程 rollout 无响应或失败影响训练,OPENFORGE RL 还采用了以下容错机制:

1.墙钟超时:为每个 rollout 任务设置时间上限。超过时间仍无响应时,OPENFORGE RL 会终止该任务并返回错误信号,让训练器可以继续从剩余 rollout 中收集数据。

2.异常 rollout 丢弃: 如果 rollout 因网络问题、任务故障或 harness 故障失败,OPENFORGE RL 不会为其分配奖励,而是直接丢弃该 rollout,避免引入误导性训练信号。


图|OPENFORGE RL 概览。

为支持在多样环境中开展 OpenForge RL 实验,研究团队还构建了一条简单的任务生成流水线,先生成指令、过滤任务,再构建 Docker 环境和验证脚本,并用开放 LLM/VLM 试跑并修补,直到通过端到端检查。环境可预装 OpenClaw、Codex 等 harness,生成任务可同时用于 SFT 和 RL。


图|数据/任务合成流水线的概览。

同规模领先,跨harness泛化更强

研究团队在工具使用(Claw)和多模态 GUI 两类长程任务上评估了 OpenForge RL。整体来看,OpenForge 训练的模型在几乎有基准上均优于同等规模的开源模型,并展现出更高的样本效率和更强的跨 harness泛化能力。

1. 基准测试表现

在 Claw 任务上,OpenForge-Claw 在多个基准上优于同规模模型,目前的任务环境能够为模型提供有效训练信号。相较于仅经过 SFT 训练的模型,经过 SFT+RL 训练的模型在鲁棒性和平均成功率上均有提升。


图|Claw Agent 在 Claw-Eval、QwenClawBench 和 MCPAtlas 上的表现。

在 GUI 任务上,OpenForge-GUI 也表现出较强竞争力。相比使用 20 万+ 任务训练的 MolmoWeb,OpenForge-GUI 只用 2.5k 个任务,就在 Online-Mind2Web 上超过前者,并在 WebVoyager 上保持竞争力;OpenForge-GUI 优于相近规模的开放基线,并在 GUI 设置中追平或超过数倍更大的模型;经过 SFT+RL 训练后,其在 3 个基准上也均优于仅 SFT 版本。


图|GUI Agent 在 OSWorld-Verified、OnlineMind2Web 和 WebVoyager 上的表现。

2.跨 Harness 泛化能力

研究团队进一步考察了模型在不同 harness 下的泛化表现。结果显示,单一 harness 训练已有一定迁移能力,多 harness 联合训练整体更优,且在复杂 harness 上的收益更明显。

不同 harness 的学习难度存在显著差异。在 ClawEval 中,研究团队使用 ReACT、ZeroClaw、OpenClaw 和 Codex 等 harness 进行评估。结果显示,工具接入更灵活的 harness 得分最高。SFT+RL 能提升大多数 harness 的表现,但在 OpenClaw 上带来的提升相对有限,这可能与其更长的 prompt、更复杂的上下文有关。

多 harness 联合训练整体更优。例如,ZeroClaw 上的分数从 46.0 提高到 48.5。研究团队认为,这可能与多 harness 训练引入的工具调用方式和控制流程多样性有关。


图|在不同 harness 下比较 OpenForge-Claw 在 ClawEval 上的表现。

未见 harness 评估中,单 harness 训练表现出一定迁移能力。例如,仅在 ZeroClaw 上训练的模型,在未参与训练的 OpenClaw 和 Codex 上也有提升。相比之下,多 harness 联合训练的整体表现更好,更丰富的工具调用方式和控制流程可能有助于提升泛化能力。


图|未见 harness 评估。

3.RL 学到的能力

RL 使模型更少依赖通用 shell,更倾向于选择合适的专用工具。在 ZeroClaw harness 下,通用 shell 调用占比从 22.6% 降至 13.9%,调用相应转向专用服务工具,轨迹长度也略有缩短。

RL 还提升了多项 Agent 的可靠性指标。在 Codex harness 下,模型的自我验证、工具覆盖率和格式鲁棒性都有所提升。


图|SFT 与 SFT+RL 在 ClawEval 上的行为比较。

不足和未来发展

尽管 OpenForge RL 在基准测试和跨 harness 泛化实验中取得了不错的结果,但依然存在以下几点不足:

首先,异常 rollout 的处理仍较为保守。运行 rollout 任务的容器可能因网络错误、harness 崩溃或超时而中断。未来,研究团队将进一步研究部分 rollout 的信用分配,让有效交互步骤能够被用于训练。

其次,错误恢复能力仍然不足。RL 能提升自我验证、工具覆盖和多步计划等能力,但错误恢复在 RL 后仍是较弱项。因此,后续研究将针对错误恢复构建专门数据,并探索相应训练方法,以进一步强化这类能力。

此外,数据和基础设施仍是扩展到更多agent环境的门槛。未来,研究团队表示将公开代码、数据集和模型,希望降低在真实 harness 和环境中训练 Agent 的门槛。

作者:夏千斯

如需转载或投稿,请直接在本文章评论区内留言

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
54岁齐达内出任法国队主帅,本人回应:在过去四五年里,我收到过执教俱乐部的邀请,但全部拒绝了,只为了等待法国队

54岁齐达内出任法国队主帅,本人回应:在过去四五年里,我收到过执教俱乐部的邀请,但全部拒绝了,只为了等待法国队

鲁中晨报
2026-07-28 17:40:08
柳智宇谈邓煜、王虹获奖:羡慕他们的纯粹,但从未后悔自己的选择

柳智宇谈邓煜、王虹获奖:羡慕他们的纯粹,但从未后悔自己的选择

新京报
2026-07-28 19:05:29
高铁上遇出差老公,秘书躺他怀里,我跟他打招呼:嫂子真年轻漂亮

高铁上遇出差老公,秘书躺他怀里,我跟他打招呼:嫂子真年轻漂亮

千秋文化
2026-07-27 19:41:57
离婚真相曝光仅6个月,前妻高调曝光追求者,撕碎猴哥仅剩体面

离婚真相曝光仅6个月,前妻高调曝光追求者,撕碎猴哥仅剩体面

挂肚逍遥心
2026-06-08 08:17:28
无需外接充电,国产全新5度电混动,或将成为家用新趋势

无需外接充电,国产全新5度电混动,或将成为家用新趋势

侃故事的阿庆
2026-07-27 10:47:14
彻底凉凉!黄一鸣案判了,结果大快人心,难怪王思聪不认孩子

彻底凉凉!黄一鸣案判了,结果大快人心,难怪王思聪不认孩子

赵昉是个热血青年
2026-06-27 19:49:44
中国女排亚锦赛14人名单曝光:三完美,二待定,六瑕疵

中国女排亚锦赛14人名单曝光:三完美,二待定,六瑕疵

林子说事
2026-07-28 13:55:29
日本人评价抗美援朝:若中国不发兵,美国根本走不到鸭绿江边,中国的出战,让西方复盘了70多年都没琢磨透

日本人评价抗美援朝:若中国不发兵,美国根本走不到鸭绿江边,中国的出战,让西方复盘了70多年都没琢磨透

磊子讲史
2026-07-28 16:07:56
陈凯歌曾评价周迅:如果身高再多上10厘米,那么整个世界就是她的

陈凯歌曾评价周迅:如果身高再多上10厘米,那么整个世界就是她的

老吴教育课堂
2026-07-26 19:34:03
邓煜首度公开回应是否回国,只字不提王虹,却句句戳心

邓煜首度公开回应是否回国,只字不提王虹,却句句戳心

月亮的麦片
2026-07-26 16:22:04
盈利同期新高,股价年内却跌超25%,中国铝业获大股东贷款增持护盘

盈利同期新高,股价年内却跌超25%,中国铝业获大股东贷款增持护盘

华夏时报
2026-07-28 21:59:05
《功夫女足》票房井喷,诞生4个赢家2位输家,张艺兴热巴位列其中

《功夫女足》票房井喷,诞生4个赢家2位输家,张艺兴热巴位列其中

剧芒芒
2026-07-18 12:33:31
倒计时5个月,特朗普砸数百亿追赶中国,美企回复很直接:做不到

倒计时5个月,特朗普砸数百亿追赶中国,美企回复很直接:做不到

启迪你的思维
2026-07-28 22:52:23
甘肃大学教师39岁脱产外出读博,46岁毕业前在宿舍脑出血后离世:家属婉拒捐款、将再告人社局,人社厅回应关键点

甘肃大学教师39岁脱产外出读博,46岁毕业前在宿舍脑出血后离世:家属婉拒捐款、将再告人社局,人社厅回应关键点

极目新闻
2026-07-28 18:16:46
1夜7大转会!皇马5进4出 穆西亚拉转会传闻 新月有意引进恩迪亚耶

1夜7大转会!皇马5进4出 穆西亚拉转会传闻 新月有意引进恩迪亚耶

童叔不飙车
2026-07-28 22:14:24
第二个许家印!又一首富栽了!世界500强竟是假的,千亿帝国清零

第二个许家印!又一首富栽了!世界500强竟是假的,千亿帝国清零

阿绐聊社会
2026-07-07 05:55:20
震惊了!坐飞机,发现了一名超像豆包的空姐

震惊了!坐飞机,发现了一名超像豆包的空姐

微微热评
2026-06-25 12:35:51
老人理财被骗600万 黄金市场成洗钱暗道

老人理财被骗600万 黄金市场成洗钱暗道

看看新闻Knews
2026-07-27 17:12:25
两年真机实测:不带手机壳、不贴钢化膜,手机最终状态出人意料

两年真机实测:不带手机壳、不贴钢化膜,手机最终状态出人意料

小柱解说游戏
2026-07-26 19:53:28
400亿遗产深锁瑞士银行已整整18年,子女屡次想提取却始终分文未得,王永庆生前布下的这步棋,让所有人哑口无言

400亿遗产深锁瑞士银行已整整18年,子女屡次想提取却始终分文未得,王永庆生前布下的这步棋,让所有人哑口无言

人生录
2026-07-22 00:05:16
2026-07-28 23:56:49
学术头条
学术头条
致力于学术传播和科学普及,重点关注AI4Science、大模型等前沿科学进展。
1459文章数 5081关注度
往期回顾 全部

科技要闻

Kimi K3开放权重,想本地部署,200万元起

头条要闻

博主"听泉赏宝"炒股亏光父母积蓄遭拉黑 称"再玩剁手"

头条要闻

博主"听泉赏宝"炒股亏光父母积蓄遭拉黑 称"再玩剁手"

体育要闻

35岁德甲球星,退役半年后成了一名农民

娱乐要闻

43岁演员王凯去世!独居公寓无人知晓

财经要闻

潘老板的算盘全砸了,欠的25亿跑不了了

汽车要闻

宾利托卡尔重塑百年菱形美学,将于9月全球首秀

态度原创

旅游
亲子
教育
艺术
公开课

旅游要闻

今日开馆!深圳新晋人气王来了

亲子要闻

几年级能看出孩子是不是读书的料

教育要闻

饶毅、倪忆两位教授发文澄清:四位北大教师为王虹赴法留学撰写推荐信

艺术要闻

俄罗斯当代女画家 Valeria Privalikhin作品

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版