网易首页 > 网易号 > 正文 申请入驻

前沿分享丨颜水成团队新作:Scaling Harness Intelligence

0
分享至

转自 学术头条

智能体(Agent)的能力并不完全由底层模型决定,负责管理记忆、制定规划、编排工具调用并在失败时触发恢复机制的 Agent Harness,同样至关重要。

一个 SOTA 基础模型,如果被置于错误的记忆策略或行动协议下,表现出的能力会大打折扣;反过来,一套精心设计的 Agent Harness,却可以“放大”一个中等规模模型的实际性能。

然而,Harness 设计仍然依赖人工、局限于特定任务,且从根本上难以扩展。

在这项工作中,新加坡国立大学颜水成教授团队及其合作者提出了JIT-Agent,将 Harness 构建从一种人工工程化、提前设计好的 artifact,转变为了一种可学习的能力,从而为任意现成的 Agentic LLM 实时合成任务自适应的 Agent Harness。


论文链接:https://arxiv.org/pdf/2608.25593

结果显示,在深度研究、日常工作、规划和工作空间任务中,JIT-Agent 生成的 Harness 能够持续增强其底层骨干模型的能力,与 OpenCode、Claude Code 等成熟 Agent 运行时处于同一竞争区间,并扩展了成本-性能边界。


研究团队表示,JIT-Agent 是首个专为即时 Harness 生成而构建的模型,将 Harness 智能确立为一种独立于模型规模扩展、可训练、可迁移、可复合的 Agent 能力维度。

研究方法

为使 Harness 能够被模型稳定生成,研究团队没有让 JIT-Agent 直接输出完全不受约束的 Agent 程序,而是建立了一个固定的四模块协议,如下:

  • Memory:决定历史交互和中间状态如何保存、压缩并呈现给模型;
  • Planning:形成下一步指令,拆分和调整任务目标;
  • Action:推进动作执行循环,处理工具调用与执行结果;
  • Capability:编排可用工具和技能,决定不同阶段暴露哪些外部能力。


这四个模块共同构成一个可组合的 Harness。固定协议规定了模块接口、生命周期、验证规则和执行语义,同时保留每个模块内部的设计空间。

据此,他们构建了HarnessFactory,将不同类型的代表性 Agent Scaffold 统一到同一套接口下。JIT-Agent 输出的是结构化、可执行的模块,而不是一段仅供阅读的自然语言描述。这样做既减少了无关的语言差异,也让生成结果能够直接进入执行流程。

为解决 JIT-Agent 训练中面临的适配性(adaptivity)、可靠性(reliability)和可进化性(evolvability)挑战,研究团队采取了以下三阶段训练:

第一阶段:看任务定制 Harness

在这一阶段中,模型通过教师模型生成的、符合协议的示例,学习如何根据任务结构选择不同的记忆、规划、动作和能力编排方式,从而理解当前任务的主要瓶颈是什么,哪些模块需要特殊设计。

例如,如果任务依赖大量外部证据,Harness 可能需要更关注检索内容的组织和工作记忆;如果任务涉及多个执行阶段,则需要让规划和状态管理能够随着阶段变化而切换;如果任务要求修改文件,则动作模块和验证机制需要围绕文件状态进行组织。

第二阶段:从失败轨迹中学习修复

仅仅生成一个结构合理的 Harness 还不够。模型输出可能存在编译错误、接口不匹配或运行时失败,因此模型还需要具备恢复能力。

这一阶段将失败的 Harness 生成过程转换成有边界的修复轨迹。模型学习识别失败原因,并在不改变整个系统的情况下,对相关模块进行修正。

这一步的关键在于,可靠性不再完全依赖外部工程师手动调试。Harness 生成器本身也被训练成能够处理自身输出的问题。

第三阶段:持续自进化

在这一阶段中,他们提出了“进化群组解耦策略优化”(Evolutionary Group-Decoupled Policy Optimization,Evo-GDPO),旨在让模型不断利用执行反馈自主生成最优 Harness。

与只追求单一任务得分不同,Evo-GDPO 分别对奖励、延迟和成本进行归一化处理。这样,模型不只是寻找“效果更好”的 Harness,也需要考虑执行效率和资源开销,推动 Model-Harness 组合不断扩展成本-性能边界。


经过上述训练,他们最终得到了一个能够即时定制、修复和进化任务专属 Harnesse 的 Harness Intelligence 模型——JIT-Agent-27B。

实验结果

研究团队在多个 Agent 基准和多个模型骨干上对 JIT-Agent 进行了评估。

结果表明,JIT-Agent 能够为不同模型带来显著的性能提升。例如,在 JIT-Agent 作为 Harness 助手的情况下,DeepSeek-V4-Flash在 DeepPlanning-Shopping 上的分数增加 24.8%,超越 GPT-5.6;GLM-5.2则在 OfficeBench、AgentIF、DeepSearchQA 榜单上全部取得 SOTA 分数。


同时,JIT-Agent 生成的 Harness 在性能上与 OpenCode、Claude Code 等成熟 Agent 运行时处于同一竞争区间,为 DeepSeek V4、Mimo-V2.5、Qwen3.6 三个模型系列带来了持续的性能提升。


下一步?

研究团队将 Harness Intelligence 视为与模型容量、推理算力并列的另一个基础 scaling 维度,而 JIT-Agent 则是实现这一目标的重要一步。

更长远的机会在于一种model–harness 协同设计范式,即基础模型与塑造其记忆、规划、行动和工具使用的操作性结构共同被训练。

不过,研究团队表示,未来的系统或许不必采用本研究中“有意为之的激进形式”——整个脚手架都可以被即时重新设计。保留一个稳定的核心 harness,同时允许模型在任务需要时构建、修订或替换其中特定的组件,或许是更好的选择。

他们认为,随着这一范式的成熟,Harness 合成、修复和进化的能力将逐渐被内化到基础模型本身。模型将不仅学会在给定 Harness 下行动,还会学会改进它所依赖的 Harness,进而衍生出关于自适应接口、可验证运行时修改、以及模型与执行系统协同扩展的更广泛研究议题。

【免责声明】转载出于非商业性的教育和科研目的,只为学术新闻信息的传播,版权归原作者所有,如有侵权请立即与我们联系,我们将及时删除。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
刘涛往长城上一站,网友说的“国泰民安脸”终于有画面了

刘涛往长城上一站,网友说的“国泰民安脸”终于有画面了

阿废冷眼观察所
2026-10-02 18:34:54
裴轶受处分会迎来反转?北理工裴轶事件,后果会很严重

裴轶受处分会迎来反转?北理工裴轶事件,后果会很严重

平老师666
2026-10-03 21:12:20
一条叫“中国乘客带头阻止劫机”的热搜,给我看无语了

一条叫“中国乘客带头阻止劫机”的热搜,给我看无语了

走读新生
2026-10-02 21:07:52
民政局离婚人数暴涨,显露一个事实:现在年轻人过不下去,其实怪父母

民政局离婚人数暴涨,显露一个事实:现在年轻人过不下去,其实怪父母

民生格物
2026-10-03 12:21:07
一个接口活了近40年,IBM自己都收不回来

一个接口活了近40年,IBM自己都收不回来

我是一个粉刷匠2
2026-10-02 00:11:27
台湾和上海都是 2000 多万人口,上半年台湾 GDP3.48 万亿,上海多少

台湾和上海都是 2000 多万人口,上半年台湾 GDP3.48 万亿,上海多少

抽象派大师
2026-09-20 16:57:21
通宵交易!华尔街将迎23小时交易时间

通宵交易!华尔街将迎23小时交易时间

环球网资讯
2026-10-04 10:13:19
重启后的舞厅乱象:按时收费两百一小时,底层舞客舞女双双熬日子

重启后的舞厅乱象:按时收费两百一小时,底层舞客舞女双双熬日子

成都人的故事
2026-09-10 07:43:30
说出来你可能不信,八国联军的总头子,那个叫瓦德西的德国佬,拎着刀在中国烧杀抢掠一圈回去之后,干了一件让全世界都没想到的事。

说出来你可能不信,八国联军的总头子,那个叫瓦德西的德国佬,拎着刀在中国烧杀抢掠一圈回去之后,干了一件让全世界都没想到的事。

回京历史梦
2026-10-02 14:35:10
一医生当众向家属“下跪”,直言“对方已跪、这样代价最小”!上级医生硬怼:不治就走,不提供情绪价值!情绪也是一种劳动,需被正视

一医生当众向家属“下跪”,直言“对方已跪、这样代价最小”!上级医生硬怼:不治就走,不提供情绪价值!情绪也是一种劳动,需被正视

梅斯医学
2026-10-04 07:55:25
孙悦谈王治郅,郅哥真的挺有意思,国家队时他每天除了训练就是看书

孙悦谈王治郅,郅哥真的挺有意思,国家队时他每天除了训练就是看书

生活新鲜市
2026-10-04 10:05:35
养老红利分配失衡:一边坐享优待,一边劝大众隐忍,值得深思

养老红利分配失衡:一边坐享优待,一边劝大众隐忍,值得深思

你在偷看谁
2026-08-27 20:41:21
亚运收官,奖牌榜:中国队341枚 男足铜牌进了新闻联播

亚运收官,奖牌榜:中国队341枚 男足铜牌进了新闻联播

追梦聊球
2026-10-04 10:22:38
评论员穆斯马拉:弗拉泰西是国米的巨大遗憾

评论员穆斯马拉:弗拉泰西是国米的巨大遗憾

懂球帝
2026-10-04 10:24:13
港片烂完了!古天乐新片国庆上映,首日票房仅100万,成垫底烂片

港片烂完了!古天乐新片国庆上映,首日票房仅100万,成垫底烂片

白面书誏
2026-10-01 15:17:35
电视剧《喜剧之王》正式官宣定档

电视剧《喜剧之王》正式官宣定档

可乐谈情感
2026-10-03 02:00:17
《征途》像张国焘这种叛徒,为何能得以“善终”?

《征途》像张国焘这种叛徒,为何能得以“善终”?

花煜寒
2026-10-03 20:42:23
俄军袭击基辅大桥,乌克兰首都50万人的日常通勤变成一场噩梦

俄军袭击基辅大桥,乌克兰首都50万人的日常通勤变成一场噩梦

世界新趋势
2026-10-03 14:35:04
iPhone 18 Pro系列开售就冲顶,这也没谁了

iPhone 18 Pro系列开售就冲顶,这也没谁了

科技锋说
2026-10-03 09:35:23
如果人民公社活到今天,农村早就不用振兴了?

如果人民公社活到今天,农村早就不用振兴了?

游文刀
2026-09-25 12:53:10
2026-10-04 11:16:49
中国人工智能学会
中国人工智能学会
中国人工智能学会网易官方账号
4318文章数 1492关注度
往期回顾 全部

科技要闻

苹果确认:iPhone 18 Pro Max有问题

头条要闻

30多年不涨价 山东一列一年亏400多万的慢火车还在开

头条要闻

30多年不涨价 山东一列一年亏400多万的慢火车还在开

体育要闻

“小将”吴曦,中国的莫德里奇

娱乐要闻

杨议没料到,郭德纲如今仍是一呼百应

财经要闻

OpenAI前安全部门员工:公司文化已崩坏

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

房产
时尚
数码
教育
本地

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

今年秋天的上衣,太上头了!

数码要闻

铭凡PCIe扩展卡ESP4B上市:可提供4个M.2与4个SATA接口

教育要闻

有些题目确实很难不会做,也很正常啊

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

无障碍浏览 进入关怀版