一个反直觉的结论正在ML工程领域浮出水面:在同等时间预算和相同前沿大模型底座下,开源最先进的Agent框架,相比一个只带读写和bash原语的极简编码Agent单会话,没有任何优势。
这项研究由Kirill Brilliantov、Alejandro Hernández-Cano和Emmanuel Abbé完成,论文发表于2026年10月。研究直指一个行业惯性——当模型能力不够时,人们习惯性地在模型外面加越来越多的机械层。
![]()
框架越堆越厚,收益却越来越薄
近年来,自主机器学习工程(MLE)Agent在公开排行榜上取得了显著进展。推动这些进展的,往往是对长周期循环中进度停滞的担忧,以及对大模型原语能力有限的判断。
于是,现代MLE Agent被部署在越来越复杂的机械结构之上:多Agent编排器、专用检索子Agent,以及更多类似的组件。这些被称为“harness”(框架/挽具)的机械层,被寄予厚望——仿佛只要把模型包裹得足够精巧,就能突破能力天花板。
但研究团队注意到一个被忽视的方向:更原始、但持续改进的编码Agent——让大模型通过读、写、bash原语直接访问执行环境——在MLE领域的应用,几乎没有得到足够关注。
换句话说,行业在拼命给模型穿盔甲,却很少有人问:如果模型本身够强,它还需要这身盔甲吗?
大规模消融实验:机械层在编码Agent场景下变得冗余
研究团队进行了一系列大规模系统性消融实验。消融实验的核心逻辑是:逐一移除系统中的组件,观察性能变化,从而判断每个组件是否真正贡献了价值。
实验条件被严格控制:同等时间预算,相同前沿大模型底座。在这个公平的擂台上,开源最先进的harness与极简编码Agent单会话正面交锋。
结果出乎很多人的意料——那些精心设计的多Agent编排器、专用检索子Agent等机械层,并没有带来可观测的性能提升。极简基线打平了顶级系统。
研究团队由此提出一个判断:在编码Agent场景下,这些机械层变得冗余。性能的主要驱动力,指向了模型底座本身,而非外围的工程架构。
这个结论对当前MLE基准测试的投入方向提出了质疑。研究团队明确表示:围绕强模型手工打造复杂harness所投入的精力,在当前MLE基准上,回报很差。
对Agent开发者的启示
这项研究并非否定工程的价值,而是指出了一个优先级问题。当模型底座足够强时,外围机械层的边际收益可能远低于预期。
对于正在构建MLE Agent的团队来说,这意味着一个需要重新审视的决策:是把资源继续投入到多Agent编排、检索子Agent等复杂架构上,还是回归更简洁的编码Agent范式,让模型直接与执行环境交互?
研究给出的信号是清晰的——在当前MLE基准测试中,后者至少不输前者,且工程复杂度大幅降低。
当然,这一结论有其边界:它针对的是当前MLE基准测试,针对的是同等时间预算和相同前沿模型底座的条件。随着基准难度提升、任务周期拉长,机械层是否会重新变得必要,研究没有给出答案。
但至少现在,一个强Agent需要的harness,可能比大多数人想象的少得多。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.