大多数编码Agent的底层架构是静态的。能力在设计阶段就被焊死,运行过程中没有任何机制能改变执行方式。华为开源的openJiuwen,就是冲着这个痛点去的——它把Agent的"运行方式"本身变成了可调整的变量。
结果相当能打:在SWE-bench Verified上拿到82.6%,在Terminal-Bench 2.1上拿到87.19%,分别比官方榜单最强成绩高出3.4和3.39个百分点。更关键的是,模型策略全程固定——也就是说,这3.4分的提升完全来自harness(执行框架)本身,而不是底下换了更强的模型。
![]()
静态harness的瓶颈在哪
传统Agent跑任务时,上下文怎么组织、反馈怎么给、任务怎么拆解,这些在启动前就定死了。一旦运行中遇到设计时没预料到的情况,Agent只能硬着头皮按原计划走,没有"临场调整"的能力。
openJiuwen的做法是引入Rail-based组合机制。开发者可以在同一个共享执行底座上,自由组装单个Agent、委派子Agent、甚至编排群体协作流程(swarm flows)。这相当于把Agent的"组织结构"从固定架构变成了可插拔模块。
运行中的实时反馈回路
光能组合还不够,openJiuwen的关键在于运行时的动态调整。它从三个维度收集证据:语义诊断(代码逻辑层面的问题)、执行结果(实际跑起来的表现)、任务进度(当前完成到哪一步)。这些实时证据会反过来重塑Agent的上下文、反馈机制和任务控制方式——任务还在跑,但"怎么跑"这件事本身在持续被优化。
打个比方:传统Agent像按固定剧本演戏的演员,openJiuwen则让导演能在拍摄过程中根据现场情况随时改剧本、调机位。
成绩归因:纯粹harness的胜利
论文里特别强调了一点:整个过程中模型策略保持不变。这意味着成绩提升不能归功于模型能力的增强,而是完全由harness的设计带来的。这对行业来说是个有意思的信号——在模型能力逐渐趋同的当下,执行框架的优化空间可能被严重低估了。
论文已发布在arXiv(编号2608.27969),也支持在线对话讨论。对于正在做Agent开发、尤其是被静态架构限制住手脚的团队来说,这份开源代码值得仔细拆解一遍。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.