让AI去改AI的代码,这件事Meta已经在做了。但最新的一篇论文指出:只让一个AI反复改,效果会卡住。把搜索拆成几条专门的分支,再让路由器把任务分给最合适的那条,四个测试场景全部超过了原来的Meta-Harness。
这篇论文来自Meta、杜克大学和加州大学的研究者。核心问题听起来有点绕:当AI要优化一个Agent的"harness",到底该怎么搜?
![]()
harness是什么,为什么值得单独优化
harness是包在大模型外面的一层代码,管着它怎么调用工具、怎么检索、怎么自我检查。模型本身不变,harness变了,Agent的表现可能差出一大截。
Meta-Harness的做法是让AI在一个循环里不断重写这层代码。问题出在评分方式上:每一个版本都拿同一批题目打分,搜索很容易一头扎进某一条路径,越走越窄。
研究者给出的解法是分支。把搜索拆成两条专门化的分支,每条分支保留自己更擅长的那批练习题,并且各自写下"什么做法有效"的笔记。
两条分支,学到的本事不一样
在数学任务上,两条分支长出了不同的能力。一条学会了验证答案,另一条学会了构建完整的推导过程。它们不是同一条路走两遍,而是各自补上了对方缺的那块。
最后加一个路由器,把任务分发给最匹配的那条分支。分支各自的强项,被路由器转化成了更高的总分。
效果最直观的一组数据来自奥数数学测试,用的是Gemini 3 Flash:准确率从Meta-Harness的46.0%提升到62.0%。四个测试场景里,这套方法全部胜出。
给做Agent自动调优的人一个提醒
论文给出的建议很直接:如果你在做Agent的自动调优,别把赌注全押在一个最终赢家上。保留几个各自专门化的harness,在它们之间做路由,比只留一个冠军更划算。
这个思路的转变在于,优化的目标从"找到最好的那一个"变成了"维护一组各有强项的选项"。搜索不再收敛到单点,而是保留多样性,再靠路由把多样性兑现成分数。
对做Agent产品的团队来说,这意味着harness可能不再是训练完就固定下来的一层配置,而是一组需要持续维护、持续分流的资产。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.