网易首页 > 网易号 > 正文 申请入驻

给AI智能体做优化时,你真的需要每次都做全套题吗?

0
分享至


假如你是一位家教老师,手上有一套100道题的题库,用来检验学生每一次学习方法调整后的效果。

每次学生换了新的学习方法,你就让他把这100道题全部重做一遍,然后根据成绩决定这个新方法好不好用。听起来很严谨,对吧?

但你有没有想过一个问题:如果学生已经把简单的20道题都做对了很多次,你还有必要每次都让他重做这20道题吗?如果有30道题是超纲的,无论换什么方法他都不会做,这30道题的存在除了浪费时间还有什么用?

这就是一群来自东京大学的研究者在优化AI智能体时撞上的真实困境,而他们的解法,或许比你想象的更聪明。

AI智能体的"外壳"比"大脑"更重要?

先说一个可能颠覆你认知的事实。

你可能以为,AI智能体表现好不好,主要看背后用的大模型强不强。GPT用得越新、参数越大,效果就该越好。

但2026年的一项研究发现,围绕同一个大模型,仅仅改变外围的控制代码,也就是决定模型该存什么、该取什么、该看到什么信息的那套逻辑,性能差异可以达到6倍之多。

这套控制代码有个专门的名字。

harness(哈奈斯,直译为"挽具"):指包裹在大模型外部、决定模型如何存储信息、检索信息、组织提示词的控制代码,可以理解为大模型的"操作手册"或者"工作流程"。

这意味着,同一匹马,套上不同的挽具,拉车的效率能差出6倍。这不是夸张的说法,是论文里实打实的数据。于是问题就变成了:既然挽具这么关键,那怎么把它设计好?

自动进化的挽具,代价却越来越贵

传统上,工程师们是手工打磨这套挽具的,靠经验、靠试错。但挽具的设计空间太大了,手工调整费时费力还未必调得好。

于是最近出现了一个新方向,叫做自动化挽具优化。简单说,就是让一个更聪明的"元智能体"(meta-agent)来当教练,不断修改挽具的代码,然后拿去考试(也就是在验证任务上跑一遍),看效果好不好,好就保留,不好就换个方向再试。

这个思路的代表作叫Meta-Harness,出自2026年的一篇论文。它的做法很直接:每一轮迭代生成几个候选挽具,然后把它们放到全部验证任务上跑一遍,取平均分,分数最高的留下来当下一轮的起点,如此循环几十轮。

问题就出在"每一轮都要跑全部验证任务"这句话上。

如果验证集有100个任务,跑一次全套评估就要执行100次任务。而如果每个任务都像终端智能体那样,需要在沙盒环境里跑上几十分钟才能出结果,那这个评估成本就直接爆炸了。论文里提到的Terminal-Bench 2.1基准测试,就是这样一个又贵又慢的评估场。

更麻烦的是,这套全量评估还是静态的。

打个比方,你带着学生复习了一整个学期,一开始有些题他完全不会做,有些题他一看就会。但随着复习深入,原来不会的题他慢慢会了,原来会的题他还是会。这时候,那些"一直都会"和"一直都不会"的题,对你判断"这次的学习方法有没有用"已经没什么参考价值了,可你还在让他每次都做一遍,浪费的全是无效时间。

这正是论文里指出的核心矛盾:随着挽具不断进化,哪些任务能真正区分出"这个挽具比那个挽具强",这个答案是在不断变化的。而全量评估死守着一份固定的验证集,完全没有跟上这种变化。

Task-CoEvolve:让考题跟着学生一起进化

面对这个问题,研究者们提出了一个叫Task-CoEvolve的方法。

Task-CoEvolve(任务协同进化):一种让验证任务集合随着挽具一起动态调整的优化框架,核心思路是每轮只评估一小部分"信息量大"的任务,而不是全部任务。

这个名字里的"CoEvolve"(协同进化)其实点出了整个方法的精髓:挽具在进化,考题也要跟着一起变。

这套方法要解决两个具体问题。第一,怎么挑出真正有信息量的任务来考。第二,只考了一部分题,怎么估算出如果考全部题目大概会是什么分数,好让不同轮次之间能公平比较。

我们一个一个来看。

### 挑题的逻辑:分歧越大,信息量越大

研究者们观察到一个朴素但很有说服力的现象:如果一道题,不同挽具的表现差异很大,有的挽具做对了、有的做错了,那这道题就特别能反映出挽具之间的优劣差距。反过来,如果一道题所有挽具都做对,或者所有挽具都做错,这道题基本就是"废题",考不考都一样,反正区分不出高下。

这个道理用统计学的语言来说,就是伯努利方差。

伯努利方差:衡量一个只有"成功/失败"两种结果的事件的波动程度,当成功率恰好是50%时方差最大,当成功率是0%或100%(永远失败或永远成功)时方差为零。

论文给出的具体计算公式是,每个任务的采样权重等于它历史成功率的伯努利方差,再加上一个鼓励探索新任务的小奖励项(针对观测次数少的任务),另外对那些"从来没被解决过的任务"设了一个小的保底权重,因为说不定哪天挽具进化到能解决它了。

这里必须停下来做一个类比,因为它揭示的不只是装饰性的比喻,而是这个设计决策真正的代价和收益所在。

想象你是一个体育老师,要给20个学生分组打篮球,看谁分组分得好。如果你选的两组人,一组是身高两米的篮球队主力,一组是从没摸过球的初一新生,那比赛结果毫无悬念,你根本看不出这个分组方式好不好用。但如果你选的两组人实力接近,一场球赛下来比分咬得很紧,这场比赛才真正能告诉你分组策略是否合理。如果你继续按老办法,每次都拉着全班48个人打全场,你会发现大部分时间都浪费在那些"注定赢"和"注定输"的对局上,真正有价值的信息其实来自那几场势均力敌的较量。Task-CoEvolve做的,就是主动把评估资源集中投向那些"势均力敌"的任务,而不是继续在早已见分晓的比赛上耗费时间。

不这么做的后果论文里也有实打实的数据支撑:他们统计了任务池里各类任务的分布,发现在文本分类的实验中,一直没人能做出来的任务和几乎所有候选都能做出来的任务,加起来始终占了超过70%的任务池。也就是说,如果继续均匀地随机抽样,你抽到的题目里,至少七成是"废题",真正有区分度的题目只占一小部分,还常常被稀释掉了。

### 打分的逻辑:只考了一部分题,怎么估算全套成绩

选出信息量大的题目只是第一步。第二步更麻烦:既然每一轮考的题目都不一样,那不同轮次的分数怎么放在同一把尺子上比较?

这里就要引入一个概念。

Horvitz-Thompson估计:一种统计学方法,通过给每个被抽中的样本乘以"1除以它被抽中的概率"这个权重,来无偏地估计整体的平均水平,即便抽样本身不是均匀的。

说得直白一点,如果某道题因为太容易或太难,被抽中的概率特别低(比如只有5%),那一旦它真的被抽到了,这次抽样结果就要按比例放大来"补偿",因为它代表的不只是它自己,而是背后那一大堆类似的、没被抽到的同类题目。

论文里给出了两种具体的估计方式。当任务的成功率普遍集中在接近0或接近100这两个极端时,用一种叫Hájek估计的公式,直接对抽中的每个结果按抽样概率的倒数加权平均。而当任务成功率普遍集中在中间地带(比如接近50%)时,Hájek估计会出问题,因为一道几乎每次都解决的题如果被极小概率抽中,它的权重会被放得极大,直接主导整个估算结果,把分数带偏。这时候要改用另一种叫锚定差值估计的方式,不直接对结果加权,而是对"这次结果和历史平均水平的差值"加权,用历史平均值当一个稳定的锚点。

论文里举了一个真实案例:在Terminal-Bench 2.1的一次实验中,如果错误地用了Hájek估计,某个候选挽具在三道题里只做对一道,原始得分是33.3%,但估算出来的全套分数却是85.9%,明显是被极小概率抽中的某道"简单题"的权重给拉爆了。换成锚定差值估计后,这种失真就消失了。

这背后其实藏着一个更普遍的道理:统计方法从来不是万能公式,选哪种估计方式,取决于你的数据长什么样子。这也是为什么论文特意做了一节对照实验,专门验证"用错了估计器会怎样",结果显示用错方法后,文本分类的准确率会掉3到3.6个百分点,这不是一个可以忽略的误差。

具体效果:省了80%的评估量,成绩不掉反升

说了这么多设计原理,实际效果到底怎么样?

论文在两个场景下做了验证。第一个是在线文本分类任务,包含法律条文预测、疾病症状诊断、化学反应物预测三个数据集,用GPT-OSS-120B做分类器,Claude Opus 4.6当"教练"来优化挽具。第二个是更硬核的Terminal-Bench 2.1,一个专门考验AI智能体能不能在命令行里完成复杂长任务的基准测试。

先看文本分类的结果。

| 方法 | 评估预算 | 评估总次数 | 平均准确率 |

| 全量搜索(Meta-Harness) | 100% | 7,800 | 48.6% |

| 固定子集(Naive) | 7% | 480 | 45.2% |

| 随机重采样 | 7% | 480 | 47.0% |

| **Task-CoEvolve** | 7% | 480 | **47.6%** |

| 固定子集(Naive) | 20% | 1,560 | 47.2% |

| 随机重采样 | 20% | 1,560 | 48.2% |

| **Task-CoEvolve** | 20% | 1,560 | **49.3%** |

这个表格里最让人意外的一行,是最后一行。用20%的评估预算,Task-CoEvolve居然反过来超过了动用全部验证集的全量搜索,49.3%对48.6%,高出0.7个百分点。评估量只用了原来的五分之一,结果反而更好。

这个反直觉的结果,论文给出了一个合理的解释:一直在同一份固定的验证集上反复打磨,反而容易让挽具过拟合到这份验证集本身,就像一个学生刷题刷太多同一套卷子,做出来的答案越来越贴合这套卷子的出题套路,一旦换成新的题目就露馅了。而Task-CoEvolve每轮都在换考题,反而无意中避免了这种"应试化"的倾向。

再看Terminal-Bench 2.1的结果。

| 方法 | 评估预算 | GPT-5.6 Luna | Qwen3.6-35B-A3B |

| 全量搜索 | 100% | 62.9% | 42.7% |

| 固定子集 | 20% | 55.1% | 39.3% |

| 随机重采样 | 20% | 59.6% | 37.1% |

| **Task-CoEvolve** | 20% | **61.8%** | **41.6%** |

这里的差距只有约1个百分点,换算成任务数,89个任务里差1个任务而已。考虑到全量搜索本来就享有"每轮都能看全部答案"的天然优势,能用五分之一的评估量追到这么近,已经很说明问题了。

而真正让人眼前一亮的,是评估成本的实际节省数字。用GPT-5.6 Luna跑Terminal-Bench 2.1,全量搜索需要处理2,888M个输入token,耗时22.2小时;换成Task-CoEvolve后降到579M个token,11.5小时,成本从117美元降到30美元,节省了80%。换成Qwen3.6-35B-A3B,搜索时间从38小时降到20.5小时。

这里有个细节值得多说两句。同样是20%的评估预算,随机重采样反而只用了124M个token,比Task-CoEvolve的579M还要少得多。这不是说随机重采样更省钱、更划算,恰恰相反,这说明随机重采样把预算大量花在了那些"运行几分钟就结束"的简单任务上,而Task-CoEvolve刻意把预算投向了那些运行时间长、多轮交互、真正能分出胜负的困难任务。省下来的钱背后,是评估质量的差异,不是同一份质量下的价格便宜。这也解释了为什么在同样20%的预算下,随机重采样的最终得分比Task-CoEvolve低了3.3个百分点。

挑出来的挽具到底长什么样

光看数字有点抽象,论文里也具体展示了Task-CoEvolve最终挑出来的挽具做了哪些改动,这部分特别有意思,能看出"进化"出来的方案有多聪明。

在文本分类任务里,被选中的挽具做了一个巧妙的融合。原本的方案只用一种文本切分方式(比如按单词切)去检索历史上相似的例子作为参考,但研究发现这在不同数据集上表现不一致,法律案例描述里,一个词组往往能指示出具体的罪名,用按词切分的方式效果好;而化学分子式和症状描述这类文本,更适合按字符片段切分。于是进化出来的挽具同时用两种切分方式各自排一次序,再用一种叫倒数排名融合(reciprocal rank fusion)的方法把两个排序结果合并起来,谁排名靠前谁就更可能被选进提示词里。这样一来,挽具不需要提前知道这道题来自哪个数据集,也能自动用上最合适的检索方式。

在Terminal-Bench 2.1里,被选中的挽具改动了一个更实际的细节:智能体在终端里敲完一条命令后,该等多久再检查结果。原来的方案是固定睡眠一段时间,不管命令是不是已经跑完了。进化出来的挽具改成了智能体主动轮询,一旦发现命令提示符已经回来了(说明命令执行完了),就立刻结束等待,不再傻等。论文提到,元智能体在提出这个改动之前,专门分析了搜索日志,发现固定的等待时间占用了任务总预算的四分之一到三分之一,而且大约五分之一的失败案例根本不是因为答案错了,而是因为超时了。

这个案例特别打动人的地方在于,它说明自动优化不只是碰运气地随机改代码,而是真的能从历史数据里"读出"问题所在,然后对症下药。

局限与留白

论文也很坦诚地指出了一个尚未解决的问题:目前Task-CoEvolve在评估一个候选挽具之前,就已经固定好了这一轮要考多少道题,考完才能看结果。这意味着它没法做到"这个候选一看就明显不行,提前中止评估节省时间",也没法做到"两个候选难分高下,那就多考几道题看看"。这种动态调整评估数量的能力,作者留给了未来的工作。

另外论文里还提到一个有意思的补充实验:他们试着用更强的模型DeepSeek-V4-Flash跑同样的搜索流程,结果发现进化了十轮,最好的候选挽具和最初的起点分数完全一样,都是70.8%,一点提升都没有。这不是Task-CoEvolve的问题,而是说明当底层模型已经足够强,本身就不需要太多外部脚手架时,挽具优化能腾挪的空间自然也就变小了。这提醒我们,任何优化方法都是在一个特定的"改进空间"里工作的,空间不存在,方法再好也无从发挥。

写在后面

读完这篇论文,最触动我的其实不是那些具体的百分比数字,而是它揭示的一个更普遍的道理:在很多需要反复评估、反复迭代的系统里,我们默认"全面检查"是最安全、最公平的做法,但全面检查本身也是有代价的,而且这个代价会随着时间推移变得越来越不划算,因为随着系统进步,原来有区分度的检查项会逐渐失去区分度。

这让我联想到软件工程里的回归测试。一个成熟的代码库往往积累了成千上万条测试用例,每次代码改动都要全部跑一遍,随着代码库越来越大,这个成本也越来越高。有没有可能借鉴类似Task-CoEvolve的思路,动态识别出哪些测试用例对当前这次改动最有区分度,优先跑这些?这不是这篇论文讨论的范围,但方法论上是相通的。

论文里那个"20%预算反而超过全量搜索"的结果,我读的时候愣了一下。仔细想想会发现,这其实是在提醒我们:更多的数据、更全面的评估,不总是等于更好的结果。有时候,杂乱无章地看太多信息,反而会让决策系统被那些没有信息量的噪声干扰,学会了"讨好评估集"而不是真正变强。这个道理放在教育、放在管理、放在很多需要反复打分排序的场景里,可能都值得琢磨琢磨。

Q&A

Q1:Task-CoEvolve是什么?

A:Task-CoEvolve是东京大学研究者提出的一种AI智能体挽具优化方法,核心思路是让验证任务集合随着挽具一起动态调整,每轮只评估一小部分信息量大的任务,而不是像传统方法那样每次都跑全部验证集,从而在保持效果的同时大幅降低评估成本。

Q2:Task-CoEvolve能节省多少评估成本?

A:在Terminal-Bench 2.1基准测试上,Task-CoEvolve能将搜索成本降低67%到80%,同时性能只比使用全部验证集的方法低约1个百分点。在在线文本分类任务上,用20%的评估预算甚至能超过使用全部验证集的方法,比使用全量搜索还要多出0.7个百分点。

Q3:挽具(harness)为什么对AI智能体这么重要?

A:挽具是包裹在大模型外部、决定模型如何存储和检索信息、如何组织提示词的控制代码。研究发现,同一个大模型仅仅改变外围的挽具设计,性能差异可以达到6倍之多,这说明挽具设计的重要性不亚于模型本身的能力。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
朱丹没结婚第一次见婆婆,就直接喊妈,原来她婆婆是火箭部的大校

朱丹没结婚第一次见婆婆,就直接喊妈,原来她婆婆是火箭部的大校

娱说瑜悦
2026-10-01 15:32:30
吹牛老爹爆坐牢爽当VIP!「用手机看前女友清凉照」 买通囚犯当佣人

吹牛老爹爆坐牢爽当VIP!「用手机看前女友清凉照」 买通囚犯当佣人

ETtoday星光云
2026-10-01 13:43:03
西蒙-高茨谈林诗栋发球:亚运会没有TTR,这个发球动作又回来了

西蒙-高茨谈林诗栋发球:亚运会没有TTR,这个发球动作又回来了

懂球帝
2026-09-30 15:39:10
央八破例改排播!《兰香如故》让路,这部20集黑马一开播就炸了

央八破例改排播!《兰香如故》让路,这部20集黑马一开播就炸了

阿废冷眼观察所
2026-10-01 00:54:34
樊振东躲在德国不回来,王楚钦说累,国乒气氛真怪

樊振东躲在德国不回来,王楚钦说累,国乒气氛真怪

罗纳尔说个球
2026-09-29 21:43:58
东航空姐下跪事件升级!目击者发声,咆哮男子辱骂威逼,官方介入

东航空姐下跪事件升级!目击者发声,咆哮男子辱骂威逼,官方介入

观锐器
2026-10-01 16:10:40
欧洲要求:把俄罗斯踢出五常,中国合法合理,俄罗斯不合规

欧洲要求:把俄罗斯踢出五常,中国合法合理,俄罗斯不合规

万里繁华
2026-09-30 10:05:15
海航惊现洋娃娃空姐,太漂亮了

海航惊现洋娃娃空姐,太漂亮了

微微热评
2026-09-30 08:13:45
最新世界排名:赵心童第1,第2换人了,肖国栋下降3位丁俊晖第15

最新世界排名:赵心童第1,第2换人了,肖国栋下降3位丁俊晖第15

求球不落谛
2026-10-01 06:32:13
第八轮中央巡视组即将进驻!很多人还搞不懂,巡视组到底有什么用

第八轮中央巡视组即将进驻!很多人还搞不懂,巡视组到底有什么用

职场资深秘书
2026-10-01 12:35:41
破案了!林诗栋夺冠领奖全程黑脸,终于知道他为什么笑不出来

破案了!林诗栋夺冠领奖全程黑脸,终于知道他为什么笑不出来

观察者海风
2026-09-30 11:42:54
日本队胸前印“日本”,韩国队胸前印韩文,中国领奖服汉字去哪了

日本队胸前印“日本”,韩国队胸前印韩文,中国领奖服汉字去哪了

林子说事
2026-10-01 00:22:29
日经225指数涨幅扩大至1%,报67425.65点

日经225指数涨幅扩大至1%,报67425.65点

每日经济新闻
2026-10-01 08:32:07
伊朗安全机构情报显示:以色列政权计划实施恐怖主义行动,例如对飞机或机场发动袭击,并嫁祸给伊朗

伊朗安全机构情报显示:以色列政权计划实施恐怖主义行动,例如对飞机或机场发动袭击,并嫁祸给伊朗

极目新闻
2026-10-01 14:34:19
新一轮联合国秘书长投票结束,中国倾向的候选人,拿到巨大优势?

新一轮联合国秘书长投票结束,中国倾向的候选人,拿到巨大优势?

奇思妙想生活家
2026-10-01 07:53:12
俄罗斯曾爆出份绝密档案:一旦与北约开战,先打中国周边两 "邻居"

俄罗斯曾爆出份绝密档案:一旦与北约开战,先打中国周边两 "邻居"

青青衫书生
2026-10-01 15:28:25
中央明确:公职人员违法违纪后工资待遇规定

中央明确:公职人员违法违纪后工资待遇规定

审计之家
2026-09-29 08:17:17
为什么宁愿天天画眉也不纹眉?看网友评论,引发共鸣

为什么宁愿天天画眉也不纹眉?看网友评论,引发共鸣

另子维爱读史
2026-09-30 15:53:56
菲律宾全国开始大罢工,要求中国帮忙度过难关,这次我们该不该帮

菲律宾全国开始大罢工,要求中国帮忙度过难关,这次我们该不该帮

喜你成疾药石无医
2026-10-01 03:09:59
最新反转!让空姐跪下道歉的男子彻底“社死”,东航的态度很明确

最新反转!让空姐跪下道歉的男子彻底“社死”,东航的态度很明确

军情观察家
2026-10-01 16:06:40
2026-10-01 16:36:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
10022文章数 569关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

鲁比奥要求伊朗代表团立即离境 伊外长凌晨登上飞机

头条要闻

鲁比奥要求伊朗代表团立即离境 伊外长凌晨登上飞机

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

宋佳二封金鹰视后 内娱奖项史即将改写

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

房产
亲子
艺术
本地
公开课

房产要闻

4000+/平!华侨城,直接把海口楼市的地板给掀了!

亲子要闻

宝爸宝妈看过来!国庆如何带娃安稳度假?专家建议孩子假期作息可以比上学时稍宽松

艺术要闻

吴冠中最后一回野外油画写生,2875万!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版