Zoom 团队做了一组对照实验:176 组匹配设置、4 个模型,把编码智能体的执行循环固定下来,只动三个变量——规划、动作空间、上下文管理。
测试基准选的是 SWE-Bench Verified 和 Terminal-Bench 2.1。前者考真实代码仓库里的问题修复,后者考终端环境下的任务执行。两个基准都指向同一件事:智能体能不能把活干完。
![]()
为什么要把 harness 单独拎出来
编码智能体的表现,通常被归因于模型本身。但这组实验的前提是:模型换着用,harness 的配置才是被逐一变化的对象。执行循环不变,变的只有规划方式、动作空间大小、上下文怎么管。
换句话说,同一套循环里,这三个旋钮拧到不同位置,结果会不一样。176 组匹配设置就是为了让这种差异可比较。
三个变量各自意味着什么
- 规划:智能体是先想清楚再动手,还是边走边看
- 动作空间:它能调用哪些工具、能执行哪些操作
- 上下文管理:历史信息怎么保留、怎么丢弃
这三项都属于 harness 的设计取舍,不是模型权重能决定的部分。Zoom 团队把它们拆开逐一变化,等于把工程侧的选择摆到了台面上。
对做编码智能体的人来说,这组实验的价值在于:当模型不再是唯一变量,harness 怎么设计就成了可以单独讨论、单独优化的对象。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.