网易首页 > 网易号 > 正文 申请入驻

Allen Institute for AI等揭示智能体脚手架自动优化的评估陷阱

0
分享至


这项由Allen Institute for AI、华盛顿大学联合发起的研究,以预印本形式于2026年7月14日发布在arXiv平台,编号为arXiv:2607.12227v1。研究团队来自人工智能领域的多个顶尖机构,对当前AI智能体研究中一个被普遍忽视却至关重要的问题提出了质疑与反思。

**给AI装备一套趁手的"工作台"**

假设你是一家工厂的工人,手头的工作效率高不高,不只取决于你有多聪明,更取决于你面前这张工作台有多好用——工具摆放是否顺手,操作手册是否清晰,流水线是否顺畅。AI大语言模型(LLM)在完成复杂任务时,面临的情形与此几乎一模一样。

研究人员把这张"工作台"叫做**harness**,可以译为"脚手架"或"工作框架"。它涵盖了AI在执行任务时所依赖的一切外围配置:给AI看的提示词、AI可以调用的工具、AI用来记录状态的记忆模块、用来验证结果对不对的检验流程,以及控制整个任务流程的逻辑规则。换句话说,harness就是AI智能体(agent)和外部世界之间的"翻译层"与"操作界面"。

以往的研究已经表明,哪怕AI模型本身不变,仅仅改变这套工作框架,AI的表现就可以有显著差异。正因如此,如何设计出更好的harness成为了一个热门研究方向。然而,手工打磨harness费时费力,每次都需要开发人员反复查看AI的操作轨迹、找出失败原因、然后修改框架。于是,研究者们开始尝试让AI自己来优化自己的工作台,这就是所谓的**自动harness进化(automatic harness evolution)**。

近年来,已有多个研究团队发表了自动harness进化方法,并声称在标准评测集上取得了亮眼的成绩。但Allen Institute for AI等机构的研究团队却发现,这些成绩背后藏着两个根本性的漏洞,让所有看起来令人振奋的进步都变得可疑起来。

**漏洞一:你在和自己的倒影比赛**

自动harness进化的基本流程是这样的:先让AI用当前的工作框架去尝试完成一批任务,收集失败案例和成功经验;然后让另一个"元AI"(meta agent)分析这些经验,提出对工作框架的修改建议;再用修改后的框架重新尝试任务,如此循环往复。最终,选出表现最好的那套框架,在同一批评测任务上汇报成绩。

问题就出在这里。自动harness进化本质上是一个**反复搜索和试错的过程**,它在评测任务上用了大量的额外计算资源——多次运行、多次分析、多次修改。那么,这个过程取得的成绩提升,究竟是因为工作框架真的变得更好了,还是仅仅因为"多试了好多次"?

这就好比一个学生参加考试,正常考法是每道题做一遍交卷。但如果允许他反复尝试、每次失败后都能看到答案并修改,最终成绩当然会更高——但这能说明他真的学会了吗?公平的比较应该是:给另一个学生同样多的"重试机会",看看他能不能也达到同样的分数,而不需要修改"做题方式"。

研究团队把这种"反复重试"的策略叫做**测试时扩展(test-time scaling)**,包括两种最简单的形式:一种是**并行采样(parallel sampling)**,即同时让AI尝试同一道题很多遍,最后选最好的一个;另一种是**顺序精炼(sequential refinement)**,即让AI在看到自己上一次的尝试后,再做一次修改和改进。这两种方法都没有改动工作框架本身,只是给AI更多机会去尝试。

**漏洞二:在自己的考卷上练题**

第二个漏洞更直接:绝大多数现有研究在搜索最优工作框架时使用的任务,和最终报告成绩时评测的任务,**是同一批任务**。

这就像一位老师把期末考试题提前给了学生练习,然后正式考试时再考同样的题,声称学生"成绩大幅提升,学习方法有效"。这种提升很可能只是记住了这批特定题目的答案,换一套新题可能完全不管用。在机器学习领域,这个现象有个专有名词叫做**过拟合(overfitting)**,通俗说就是"死记硬背,不懂举一反三"。

正是基于这两个根本性的问题,研究团队决定做一次彻底的重新评估:在公平的条件下,自动harness进化到底有没有用?

**四种方法进行"公平擂台赛"**

为了做出公平比较,研究团队设计了一套统一的预算框架,明确规定每种方法能使用多少计算资源、能获得哪些反馈信号。他们把四种方法放在同一个擂台上较量。

第一种是并行采样:用固定不变的工作框架,针对同一个任务同时生成多条解答路径,最后从中挑选最好的一条。工作框架自始至终一个字都不改,所有投入都花在"多试几次"上。

第二种是顺序精炼:同样保持工作框架不变,但让AI看到自己上一次的尝试结果后,再产出改进版的答案。每次尝试都站在前一次的肩膀上,但"肩膀"本身(工作框架)没有变。

第三种是harness进化(即被质疑的主角):让AI分析一批任务上的失败经验,由元AI提出对整个工作框架的修改方案,修改后的框架会被复用到所有任务上。这是跨任务共享的框架优化。

第四种是研究团队自己提出的新基准方法,叫做**harness扩展(harness scaling)**:这个方法的思路是,把修改工作框架这件事也下沉到单个任务的层面——针对每一道具体任务,让元AI根据这个任务的失败经验来修改框架,修改后的框架专门为这个任务服务,不跨任务共享。这个方法介于"改工作框架"和"多试几次"之间,是一个有趣的中间地带。

实验在**Terminal-Bench 2.1**这个评测集上展开。Terminal-Bench是一个专门测试AI智能体在命令行界面完成真实复杂任务能力的基准,2.1版本修复了前一版本中28个存在外部依赖漂移、资源预算错误、指令与测试不一致等问题的任务,共保留89个终端任务。参与测试的模型包括三个当前最前沿的大语言模型:Claude Opus 4.6、GPT-5.4和GPT-5.4 mini。每种方法的计算预算统一设定为K=5轮,每轮对每个任务采样一条轨迹,确保所有方法消耗的计算量可以直接比较。

**没有测试用例时:简单的"多试几次"完胜**

第一场比较在没有单元测试用例(unit test cases)的条件下进行。所谓单元测试用例,就是可以自动判断AI的解答对不对的验证程序。当没有这种程序时,AI只能依靠自己评估自己的答案好不好,相当于"闭卷自批"。

结果出乎很多人的预料。以初始工作框架的直接采样为基线,平均得分为68.2分。并行采样把平均分提高到72.3分,在三个模型上全都有所提升,是最稳定的方法。顺序精炼的提升非常有限,平均只提高了1.1分,而且在GPT-5.4上甚至比直接采样还差了一点点。

harness进化呢?平均分跌到了67.4分,不仅没有超过最简单的并行采样,甚至低于什么都不做的直接采样基线。最糟糕的情况出现在GPT-5.4上:得分从75.3分直线跌落到69.7分,说明在没有可靠外部信号的情况下,AI自己判断自己的框架改得好不好,很容易越改越糟。

harness扩展(针对单个任务修改框架)的表现介于中间,平均得71.8分,在Claude Opus 4.6上表现最好,但整体仍然不如并行采样。

这个结果传达了一个重要信号:当没有外部的"标准答案"可以验证时,AI自我修改工作框架的过程本质上是一种有噪声的猜测游戏,猜错了会积累错误。相比之下,单纯让AI多试几条不同路径,反而更保险。

**有了测试用例:harness进化依然落后**

第二场比较引入了单元测试用例——AI现在可以知道自己的解答到底对不对了。这相当于给学生发了一本"答案书",可以边做边对答案。按理说,有了这个可靠的反馈信号,harness进化应该能更准确地找到框架的问题所在,表现应该大幅提升才对。

然而,实验结果依然令人意外。研究团队同时报告了两个指标:pass@1(在单次尝试中成功解决任务的比例)和pass@5(在5次尝试中至少有一次成功的比例)。

在pass@1指标上,harness进化的平均分为75.8,仅比直接采样的72.9提高了不到3分,而并行采样直接达到了86.0分。顺序精炼的pass@1也达到84.3分,明显优于harness进化。harness扩展平均82.6分,同样超过了harness进化。

在pass@5指标上,顺序精炼以平均91.8分稳居第一,harness进化只有86.2分,harness扩展89.3分。

研究团队在分析这些数据时提出了一个犀利的观察:如果harness进化真的产出了更好的工作框架,那么它的优势应该首先体现在pass@1上——因为一个更好的框架应该让AI在单次尝试中就能解决更多问题。但实际上,harness进化在pass@1上几乎没有优势,它在pass@5上勉强追平甚至落后,说明它的收益几乎全部来自"多次尝试"这件事本身,而不是框架真的变好了。

**换一批新题:进化成果几乎烟消云散**

第三场比较是最能说明问题的一场。研究团队把Terminal-Bench 2.1的89个任务分成三组:45个用于训练(让harness进化在上面迭代优化),10个用于验证(从中选出表现最好的框架),34个用于测试(完全没见过的新任务,用来汇报最终成绩)。

这个设计的意义在于:如果harness进化真的找到了普遍适用的更好框架设计原则,那么在新任务上也应该有所提升。但如果它只是记住了训练任务的特定模式,新任务上就不会有什么收获。

结果非常清楚。以初始框架在测试集上的直接采样为基线,Claude Opus 4.6得63.3分,GPT-5.4得72.1分,平均67.7分。经过在训练集上完整进化、在验证集上选出最优框架之后,Claude Opus 4.6提升到64.5分(仅+1.2分),GPT-5.4分毫未动仍是72.1分(+0.0分),平均只提升了0.6分。

0.6分的提升在统计意义上几乎可以忽略不计。这与harness进化在训练集上(即它被优化的那批任务上)展示出来的收益形成了天壤之别,清楚地表明:当前的harness进化算法学到的,是如何应对那几十道特定的训练题,而不是如何成为一个更好的AI工作框架。

**进化了什么,又没能进化什么**

为了更好地理解为何进化效果有限,研究团队仔细分析了元AI在每次迭代中究竟做了哪些修改,以及这些修改为何没能产生预期的效果。

harness进化模式下,元AI的第一步几乎总是改提示词:在系统提示中加入行为规则,比如"要尽早产出结果,注意资源预算"、"在修改重要文件之前先备份"、"完成任务前再次核查要求"。当这些语言层面的提醒逐渐失去效果时,元AI会升级到更强力的手段,比如添加中间件(middleware)——在AI完成任务的过程中插入监控程序,追踪还剩多少轮次、截断过长的工具输出、在AI宣布完成之前检查必要的文件是否已经产出。工具层面也有修改,比如纠正误导性的工具使用说明,在命令执行时注入错误恢复提示。

harness扩展模式下,元AI的主要做法是把上一次失败中发现的具体知识直接写进下一次的提示词或记忆模块。比如记录某个特定任务中已知的bug、正确的实现模板、需要检查的文件路径、推荐的命令序列。很多修改集中在提升效率上:把反复查询和探索性命令替换成更紧凑的命令计划,跳过不必要的环境检测,为慢速的包安装命令设置更长的超时时间,以及给出明确的消息轮次预算来规范工作流程。另一类常见修改是强化验证行为,让AI在最终提交前自己先做一遍类似于官方测试的检查。

这些修改听起来都很合理,也都指向了真实存在的问题。然而,研究团队发现了一个根本性的局限:这些修改大多数是在**记忆具体的解法**,而不是在**提炼通用的策略**。换句话说,AI在优化框架时做的事更像是"记笔记",而不是"总结规律"。一个有能力的AI智能体,在正常的单次执行过程中本来也能自己探索出这些具体知识,所以把它们写进框架里,只是节省了一点重复探索的时间,并不能让AI真正解决它原本解决不了的问题。

那些真正难的任务——那些需要深度领域推理、或者受到工作框架之外的条件约束的任务——在所有的优化轮次中依然岿然不动,没有被任何框架修改所攻克。与此同时,随着框架里塞入越来越多的"记忆内容",提示词越来越长,反而可能引入新的干扰,抵消掉已经取得的那点微薄收益。

**为什么Terminal-Bench可能天生就不适合测试这件事**

研究团队还提出了一个更宏观的反思:即便撇开评估方法的问题,Terminal-Bench本身可能就不是一个能够充分体现harness设计价值的评测场景。

这个基准测试中的任务以命令行操作为主,一套只有基础bash工具加简单提示词的最小化框架,对大多数可解的任务来说已经够用了。AI能不能解决这道题,主要取决于它自身的推理能力,而不是工作框架配置得有多精妙。在这种情况下,修改提示词、工具设置或中间件,自然只能带来边际收益。

真正能体现harness设计价值的场景,应该满足两个条件:任务足够难,让AI有足够大的提升空间;同时,任务的成败对框架设计非常敏感,比如需要调用特定的专业工具、执行特定的技能或遵循特定的工作流程才能成功。在这样的场景下,一个更好的框架能够真正打开AI原本解决不了的问题的大门。

**这项研究告诉我们什么**

说到底,这项研究做的事情有点像是一个"质量检查员",它没有发明新技术,而是站出来说:"等等,我们现在评价这些技术的方式是有问题的。"

这个发现的意义并不在于证明自动harness进化这个方向走不通,而在于指出:现有的评估方式存在系统性漏洞,使得那些看起来令人振奋的进步数字无法被可靠地信任。研究者们在相信一项技术之前,需要回答更基础的问题:这个技术真的比"多试几次"更有价值吗?它学到的改进在换了一批新任务之后还管用吗?

对于AI领域之外的普通人来说,这项研究的提示同样有现实意义。当你看到某种AI优化技术声称"性能提升X%"时,值得追问的是:这个提升是在什么条件下测出来的?和哪些对手比较?换个场景还管用吗?一项技术在精心设计的测试场景上看起来很好,不代表它真的解决了问题。

当然,这并不意味着harness进化这条路是死路一条。研究团队明确指出,未来的工作应该在任务难度更高、对框架设计更敏感的新基准上重新评估这类方法,并且在评估时严格区分"用来优化框架的任务"和"用来评测最终效果的任务",同时始终将"多试几次"这个最简单的基线纳入比较。

有兴趣深入了解这项研究细节的读者,可以通过arXiv编号2607.12227查找完整论文。

Q&A

Q1:自动harness进化和普通的"多试几次"有什么本质区别?

A:自动harness进化的目标是修改AI的整个工作框架(包括提示词、工具配置、中间件等),让框架本身变得更好,产出一个可以复用的通用改进。而"多试几次"(即测试时扩展)只是在不改框架的前提下,给AI更多机会去尝试同一个任务。这项研究发现,在公平的计算预算对比下,harness进化带来的收益大多可以用"多试几次"来解释,框架本身并没有变得真正更好,尤其是在面对新任务时几乎没有泛化能力。

Q2:Terminal-Bench 2.1是什么样的评测集?

A:Terminal-Bench 2.1是一个专门测试AI智能体在命令行界面完成复杂真实任务能力的基准测试集,共89个任务。它是对之前版本的修复和改进,修正了28个存在外部依赖问题、资源预算错误或指令与测试不匹配的任务,使评测结果更加准确可靠。这项研究使用它配合Claude Opus 4.6、GPT-5.4和GPT-5.4 mini三个前沿模型进行实验。

Q3:harness进化为什么在训练任务上表现好,换新任务就失效?

A:研究发现,harness进化过程中元AI做的修改大多是把特定任务的具体解法记录进框架,比如某个任务的正确命令顺序、已知的bug修复方式等。这些"记忆"对训练时见过的任务有帮助,但不是通用规律,换了新任务就没有参考价值了。真正难解决的任务,根源在于模型自身的推理能力不足,而不是框架设计问题,框架修改对此无能为力。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
郑钦文球迷意难平!不止因为0-2资格赛出局,更多在于以下四点!

郑钦文球迷意难平!不止因为0-2资格赛出局,更多在于以下四点!

宝哥精彩赛事
2026-08-02 06:05:50
深夜,歹徒闯入家中对她施暴近两个小时,她咬紧牙关一声不吭,只为保护楼上熟睡的女儿。当警察破门而入时,才发现这位母亲早已浑身是血

深夜,歹徒闯入家中对她施暴近两个小时,她咬紧牙关一声不吭,只为保护楼上熟睡的女儿。当警察破门而入时,才发现这位母亲早已浑身是血

人生录
2026-07-30 00:05:11
他汀立新功!哈佛研究:这2种他汀不仅不伤肝,还能降低肝癌风险

他汀立新功!哈佛研究:这2种他汀不仅不伤肝,还能降低肝癌风险

健康之光
2026-08-01 19:15:04
社保十年大倒查!最容易坐牢的不是欠缴,是这两种“捷径操作”

社保十年大倒查!最容易坐牢的不是欠缴,是这两种“捷径操作”

白米饭怎么吃
2026-08-01 20:01:18
六百美金房租纠纷,留美博士夫妻被租客砍死,满屋是血

六百美金房租纠纷,留美博士夫妻被租客砍死,满屋是血

法纪实录簿
2026-08-01 00:05:03
他睡过董卿又甩了,娶小20岁嫩妻躺平大理,如今62岁成人生赢家

他睡过董卿又甩了,娶小20岁嫩妻躺平大理,如今62岁成人生赢家

观察者小海风
2026-07-31 12:15:53
中超最新积分战报:津门虎创造奇迹,上海海港倒下,北京国安绝杀

中超最新积分战报:津门虎创造奇迹,上海海港倒下,北京国安绝杀

足球狗说
2026-08-01 22:17:44
22岁女孩失联后续:家属曝内幕,失联原因令人不解

22岁女孩失联后续:家属曝内幕,失联原因令人不解

麦芽是个小趴菜
2026-08-01 12:53:15
曼城点球大战总分2-4国米,努里、胡桑诺夫、尼科失点

曼城点球大战总分2-4国米,努里、胡桑诺夫、尼科失点

懂球帝
2026-08-01 21:45:32
大衣哥朱之文在景区演出,唱到一半突然停了,直接说:“我不演了”。不是设备出毛病,也不是台下有人闹事,其实是...

大衣哥朱之文在景区演出,唱到一半突然停了,直接说:“我不演了”。不是设备出毛病,也不是台下有人闹事,其实是...

背包旅行
2026-07-31 11:39:13
“这俩男孩心思不单纯!”和妈妈打闹视频火了,这个年龄其实什么都懂

“这俩男孩心思不单纯!”和妈妈打闹视频火了,这个年龄其实什么都懂

熙熙说教
2026-08-01 19:14:43
国足归化目标+1!“航体之王”公开喊话:梦想代表中国队出战!

国足归化目标+1!“航体之王”公开喊话:梦想代表中国队出战!

绿茵舞着
2026-08-01 21:44:56
打不了!不来打!中国男篮亚预赛可怎么办!别真创历史新低了!

打不了!不来打!中国男篮亚预赛可怎么办!别真创历史新低了!

林木体育解说
2026-08-01 17:35:34
交警再次提醒:误闯红灯后只需一个动作,可以从扣6分变成只扣1分

交警再次提醒:误闯红灯后只需一个动作,可以从扣6分变成只扣1分

今日观众
2026-07-30 03:00:03
太卷了!934元南宁送重庆跑腿单20秒被抢,网友:这趟下来,才赚百八十块,还要赔上2天一夜

太卷了!934元南宁送重庆跑腿单20秒被抢,网友:这趟下来,才赚百八十块,还要赔上2天一夜

火山詩话
2026-08-02 04:23:17
一场6-2!可怕的不是输球,而是杭州足管主帅赛后这番话,很清醒

一场6-2!可怕的不是输球,而是杭州足管主帅赛后这番话,很清醒

江启
2026-08-02 01:41:40
中国歼36要来了?国防部正式回应,美媒承认失败,美军已落后十年

中国歼36要来了?国防部正式回应,美媒承认失败,美军已落后十年

乌克兰小静
2026-08-02 03:06:55
两部门联合发布高温健康风险预警

两部门联合发布高温健康风险预警

界面新闻
2026-08-01 19:54:36
马帅首秀翻车!21岁小将闪击,曼城连续3点球不中,2-4不敌国米

马帅首秀翻车!21岁小将闪击,曼城连续3点球不中,2-4不敌国米

钉钉陌上花开
2026-08-01 21:35:00
市值从126亿暴跌到16亿!曾爆火全网的IF椰子水,迎来上市后最大业绩考验

市值从126亿暴跌到16亿!曾爆火全网的IF椰子水,迎来上市后最大业绩考验

红星新闻
2026-08-01 19:38:08
2026-08-02 07:16:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9397文章数 567关注度
往期回顾 全部

科技要闻

特斯拉拆不掉中国制造

头条要闻

德意等22国领导人紧急签联名信 西班牙首相反怼:自私

头条要闻

德意等22国领导人紧急签联名信 西班牙首相反怼:自私

体育要闻

1米76的他,为什么是史上最强中卫之一?

娱乐要闻

韩路批董宇辉“又当又立”?

财经要闻

长鑫科技四万亿市值背后的资本与周期

汽车要闻

历史性里程碑时刻 零跑7月交付达101267台

态度原创

手机
旅游
艺术
家居
教育

手机要闻

曝小米手机今晚涨价300元起,影响小米17系列、K90、Turbo 5

旅游要闻

山东周末游|周末奔赴枣庄,畅享盛夏文旅消费盛宴

艺术要闻

这真的是素描?不是黑白照片?每一根毛发都在呼吸,放大一百倍都找不到一条废线!

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

国网信通招计算机科学与技术、通信工程!专科+专升本+央企..

无障碍浏览 进入关怀版