网易首页 > 网易号 > 正文 申请入驻

跑一个AI智能体到底要花多少钱:这个数字可能会吓到你

0
分享至


先说一个具体的数字。

在SWE-bench Verified这个评测集上,让一个顶尖大模型跑一遍完整测试,光是模型调用费用就要花掉几百美元。如果换成SWE-bench Multimodal这样步骤更长的评测,单次跑完能烧掉超过2200美元。这还只是一次评测。

如果你是做AI智能体研发的团队,这个数字意味着什么?意味着你每改一次提示词、每调一次工作流程、每换一个底层模型,都要重新掏出几百甚至上千美元去验证效果好不好。一个开发周期里跑个几十次评测很正常,几百美元乘以几十次,账单很快就滚到让人肉疼的地步。

这篇来自上海交通大学、新加坡管理大学等机构的论文,就是奔着这个钱包痛点去的。

**评测贵,贵在哪**

*智能体(Agent)*:一种能自主执行多步骤任务的AI系统,通常由一个底层大语言模型加上具体的操作框架(比如读文件、跑命令、调工具)组成,业内也称为"脚手架(scaffold)+ 模型"的组合。

智能体评测和普通问答测试不一样。问答题问一句答一句,成本可控。但智能体要解决一个真实的软件问题,得先读代码、跑测试、发现报错、改代码、再跑测试,这个循环可能要来回几十次才能收尾。每一步都要调用一次大模型,步骤越多,账单越厚。

在这之前,学术界已经想过办法降成本,思路是"减少要测的题目数量"。比如从500道题里挑出几十道有代表性的,跑这几十道就能大致猜出跑全部500道的分数。这类方法统称为*基准蒸馏(benchmark distillation)*:通过筛选或压缩评测任务集合,用更少的题目逼近全量评测的结果。

这条路确实有效,但它只解决了"测多少题"的问题,没有碰"每道题测多久"这件事。就像你要检查100份作业,蒸馏方法帮你把100份压缩成20份抽查,可这20份作业你还是得从头看到尾。这篇论文琢磨的是另一个方向:能不能不看完整份作业,看到一半就知道这道题对不对?

**一个真实案例揭开的秘密**

研究者们翻出了一条公开的智能体运行记录,任务是修复tianocore/edk2-pytool-library项目里的一个路径处理bug。整个过程跑了45步才提交最终答案,但仔细看这条轨迹会发现一件有意思的事。

第20步,智能体写了个脚本复现了bug。第23步,它对源代码做了唯一一次修改,把路径分隔符改对了。从第23步之后一直到第45步,智能体再也没碰过源代码,剩下的22步全在各种测试和折腾。

如果有个"上帝视角"的观察者,手里拿着标准答案,在第23步就能看出这个修改是对的,任务已经实质性完成了。剩下的22步,说白了就是在原地打转。

这个发现戳中了一个反直觉的事实:我们默认智能体的评测必须等到它自己喊"提交"才算数,但实际上,胜负手往往在中途就已经写定了,只是没人在那个时刻按下暂停键。

**EarlyEval:给智能体装一个提前下课的铃**

基于这个观察,研究团队提出了EarlyEval,核心思路很简单:训练两个"裁判",一个专门识别"这局要赢了"的信号,一个专门识别"这局要输了"的信号,边跑边判,一旦某个裁判拿到足够把握,就直接喊停,把预测结果当成最终成绩。

这两个裁判用的是*LightGBM*:一种基于决策树集成的机器学习算法,训练和预测速度极快,能在单个CPU核心上不到一毫秒内处理几百个维度的特征,非常适合需要频繁打分的场景。

为什么是两个独立的裁判,而不是一个又判赢又判输的裁判?研究者的解释是,成功和失败的信号往往是不对称的。判断"这题稳了"需要看到正确的修复代码被写下来;判断"这题凉了"则要看智能体是不是在原地反复重试同一个错误、面对同样的报错信息死循环。这两种模式长得完全不一样,混在一起训练反而会稀释信号。

这就好比考试监考老师同时要盯两件事:谁提前写完卷子快步走出考场(大概率会做),谁在最后十分钟还在疯狂翻书找不到答案在哪页(大概率要挂)。这是两种完全不同的肢体语言,用同一套标准去识别,反而两种都识别不准。如果不这样拆开训练,论文的架构消融实验显示,用单一线性模型去同时判断成功失败,在SWE-bench Verified上的准确率只有43.8%,误差高达5.5个百分点,基本没法用。

**裁判靠什么信号做判断**

EarlyEval给两个裁判喂了三类食粮。

第一类是行为特征,覆盖了37种活动计数(比如智能体一共读了几个文件、改了几次代码、跑了几次测试)、最近一步的操作类型、关键事件的发生时间(第一次报错在第几步、第一次通过测试在第几步)、还有一些能反映"卡住"的信号,比如反复搜索同一个东西、连续多次只读不改。这一类特征加起来一共115个维度。

第二类是文本特征,把任务描述、动作历史、环境反馈这些自然语言内容,用*TF-IDF(词频-逆文档频率)*:一种衡量词语在文档中重要程度的经典文本表示方法,常用词权重低,特有词权重高,转成数字向量,再压缩成低维表示,一共320维。

第三类是参考解特征,只有当评测集公开了标准答案(比如SWE-bench Verified提供了官方补丁)时才能用,衡量智能体当前修改和标准答案在文件、函数名、测试用例上的重合程度,一共82维。

这里有个细节值得说一说。研究者发现,即使完全去掉第三类参考解特征,性能损失也很小,覆盖率只从34.8%掉到32.1%,节省的步骤只从26.0%降到24.7%。也就是说,行为特征和文本特征已经能撑起大部分判断力。这个发现很重要,因为很多评测集根本不公开标准答案,比如论文里测试的TerminalBench和Toolathlon就没有官方补丁,如果方法严重依赖参考解,这些评测集就用不上了。

**三个战场的实测结果**

研究团队在三个评测集上验证了EarlyEval:SWE-bench Verified(软件问题修复,500道题)、TerminalBench(命令行自动化操作,89道题)、Toolathlon(复杂工具调用,108道题)。为了模拟真实场景,采用的是"留一法"评测协议,也就是训练时故意藏起一个智能体不让它参与训练,专门拿它来测试预测准不准,避免"考试作弊"式的数据泄漏。

结果显示,在SWE-bench Verified上,把判断阈值设到0.95(意味着裁判要有95%的把握才敢喊停),能提前终止约35%的运行,准确率95.0%,节省26.0%的执行步骤,输入token省了32.7%,输出token省了28.7%,而最终测出来的成功率只比真实值偏差1.1个百分点。

在TerminalBench和Toolathlon上,即便在更严格的"训练集里连模型和框架都不能出现"的双重隔离条件下,依然能节省13%到26%的步骤,准确率维持在89%到97%区间,成功率偏差控制在2个百分点左右。

更让人意外的是排行榜的稳定性。研究者用EarlyEval跑出来的分数重新排了一次智能体的名次,和跑完整流程排出来的名次做对比,SWE-bench Verified上的排名相关系数达到0.991(满分1.0代表完全一致),16个智能体里有81%的名次分毫不差。哪怕是最难的TerminalBench无重复模型场景,相关系数也有0.959。

这意味着什么?意味着你不需要为了在排行榜上争一个准确名次而把每次评测都跑到底,早停版本给出的排序结论基本可信。

**和其他判断方式比一比**

论文还做了一组对照实验,把LightGBM换成其他架构,看看谁的性价比最高。

换成多层感知机(MLP,一种简单的神经网络),准确率掉到87.9%,节省步骤只有20.0%,成功率偏差涨到3.3个百分点,全面落后。

换成直接对密集特征做逻辑回归,准确率只有43.8%,几乎是瞎猜。

换成只对TF-IDF文本特征做逻辑回归,准确率倒是有79.5%,但触发条件太苛刻,只在2.4%的运行里敢下判断,等于基本不干活。

最有意思的对照组是用一个经过LoRA微调的小型语言模型(Qwen-0.5B)直接当裁判,读原始轨迹文本做判断。这个方案准确率90.7%,成功率偏差只有0.8个百分点,表现相当不错,但它的节省步骤只有17.9%,明显比LightGBM的26.0%少。原因很简单:用语言模型当裁判,每一步都要跑一次模型推理,这个推理开销本身就要花钱花时间,相当于为了省钱又多花了一笔钱,把省下来的部分吃掉了一半。

这就好比雇一个专家每隔五分钟就来检查一次工地进度,专家判断很准,但专家的工时费本身就不便宜,检查得越勤,请专家的钱花得越多,反而抵消了提前收工省下的材料费。LightGBM便宜就便宜在它判断一次几乎不要钱,可以随时随地插一脚看一眼,不心疼。

**这套方法的边界在哪**

论文也很坦诚地说明了适用条件。EarlyEval需要一批已经跑完、带有真实结果标签的历史轨迹数据来训练裁判,这对成熟评测集不是问题,因为公开评测集通常会积累大量历史提交记录和排行榜数据。但如果是一个全新发布、还没有任何人跑过的评测集,这套方法就无从下手,因为没有历史数据可学。

另外,研究者特别强调,EarlyEval提前预测的分数存在1到2个百分点的系统性偏差,不适合用来生成正式发布、要被引用的权威评测成绩。它的定位更像是研发过程中的快速反馈工具,帮团队在频繁迭代阶段快速判断改动是好是坏,等到要出正式榜单的时候,还是应该老老实实跑完整流程。

写在后面

读完这篇论文,我最触动的一点是它揭示了一个我们平时容易忽略的事实:结果的确定性和过程的完成度,其实是两件可以分开的事。

我们习惯性地认为,要知道一件事的结果,就必须等它彻底做完。但这篇论文用实打实的数据证明,很多时候答案早就写好了,只是流程还在惯性地往前走。这个观察其实可以推广到很多场景,比如面试官在候选人回答到第三句话时其实已经心里有数了,剩下的十分钟对话更多是走流程;比如产品经理在看到用户测试的前五个反馈时,其实已经能猜到这个功能大概率会失败。

另一个让我意外的细节是,参考答案居然不是最重要的信号。直觉上,有标准答案对照肯定能判断得更准,但实验数据显示去掉参考解特征只损失了一点点性能。这说明智能体在"要成功"和"要失败"时展现出来的行为模式本身就足够独特,识别这些模式甚至不需要知道正确答案是什么,就像一个经验丰富的老师,光看学生做题时的犹豫和反复,不用对照答案也能大致猜出这道题他会不会做。

这篇论文没有解决的问题是,如果一个全新的评测集刚刚发布,还没有任何历史数据积累,这套方法就用不上。对于快速迭代、评测集本身也在频繁更新的领域,这个冷启动问题恐怕会一直存在。

Q&A

Q1:EarlyEval是什么?

A:EarlyEval是一个通过预测智能体最终结果来提前终止评测运行的框架,它训练两个LightGBM分类器分别判断"任务成功"和"任务失败"的信号,一旦置信度达标就提前喊停,从而节省评测所需的计算成本。

Q2:EarlyEval会不会影响评测结果的准确性?

A:会有轻微影响,但幅度很小。论文数据显示,在多个评测集上,EarlyEval预测出的成功率与真实完整跑完的成功率相比,平均偏差只有1到2个百分点,同时排行榜名次相关系数保持在0.959以上。

Q3:EarlyEval适合什么场景使用?

A:它适合智能体研发过程中的频繁迭代评测,比如反复调试提示词或调整框架时的快速反馈,但不适合用来生成正式发布的权威评测成绩,正式榜单仍建议跑完整流程。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
缅甸妙瓦底电诈园区“死灰复燃”,通过社交媒体公开招募成员,王星曾被骗至此处

缅甸妙瓦底电诈园区“死灰复燃”,通过社交媒体公开招募成员,王星曾被骗至此处

扬子晚报
2026-09-29 16:11:18
金鹰奖名场面!宋佳二封视后于和伟拿视帝,杨紫遗憾陪跑咬牙鼓掌

金鹰奖名场面!宋佳二封视后于和伟拿视帝,杨紫遗憾陪跑咬牙鼓掌

萌神木木
2026-09-29 21:54:52
四川成都一顾客在Tiffany消费超20万后,承诺的中秋月饼未送反以散装桃酥补偿,顾客发帖吐槽账号被限,Tiffany中国零售团队通过邮件致歉

四川成都一顾客在Tiffany消费超20万后,承诺的中秋月饼未送反以散装桃酥补偿,顾客发帖吐槽账号被限,Tiffany中国零售团队通过邮件致歉

大风新闻
2026-09-29 11:17:10
国乒清晨回国!各主力展疲惫,大家免税店购物,孙颖莎展露笑容!

国乒清晨回国!各主力展疲惫,大家免税店购物,孙颖莎展露笑容!

篮球资讯达人
2026-09-29 12:56:52
国资委副主任,向百万亿央企“传达”新任务

国资委副主任,向百万亿央企“传达”新任务

华夏能源网
2026-09-29 20:28:40
广东引援新消息,不是梅克、麦基,赌一把NBA榜眼秀,组建三剑客

广东引援新消息,不是梅克、麦基,赌一把NBA榜眼秀,组建三剑客

体坛小快灵
2026-09-29 14:30:37
被骗了132年?甲午海战北洋水师根本没有对日作战优势

被骗了132年?甲午海战北洋水师根本没有对日作战优势

老达子
2026-09-29 06:20:10
新强人出现,德国大规模武装,法国波兰坐立不安,美俄选边站

新强人出现,德国大规模武装,法国波兰坐立不安,美俄选边站

老范谈史
2026-09-29 21:21:52
央视发声,又一女间谍曝光!大量航天机密遭泄露,作案手段太高超

央视发声,又一女间谍曝光!大量航天机密遭泄露,作案手段太高超

少女的烦恼
2026-09-28 22:52:28
皇马两将贝林厄姆和库库雷利亚在国家队比赛时相遇,爆发激烈口角

皇马两将贝林厄姆和库库雷利亚在国家队比赛时相遇,爆发激烈口角

福酱的小时光
2026-09-29 07:37:46
宏远速递!徐杰体测成绩CBA第一,周鹏胡明轩联合发声,官方又有新动作

宏远速递!徐杰体测成绩CBA第一,周鹏胡明轩联合发声,官方又有新动作

多特体育说
2026-09-29 16:24:27
iPhone 18 Pro Max 首发接连翻车,果粉集体炸锅!

iPhone 18 Pro Max 首发接连翻车,果粉集体炸锅!

芝麻科技讯官方号
2026-09-27 23:35:38
赌王三太庆祝71岁生日,齐娇带2个孩子为奶奶祝寿

赌王三太庆祝71岁生日,齐娇带2个孩子为奶奶祝寿

素素娱乐
2025-03-03 08:39:28
亚运会女子链球:小将张家乐破亚洲纪录夺金,中国选手包揽冠亚军

亚运会女子链球:小将张家乐破亚洲纪录夺金,中国选手包揽冠亚军

全景体育V
2026-09-29 19:44:36
遭全网抵制!拿没教养当个性的她,终于惹众怒,难怪连郝蕾都嫌弃

遭全网抵制!拿没教养当个性的她,终于惹众怒,难怪连郝蕾都嫌弃

青杉依旧啊啊
2026-08-11 14:41:17
医生直言:一片西地那非在你体内走了一趟,干了5件事你未必知道

医生直言:一片西地那非在你体内走了一趟,干了5件事你未必知道

医学科普汇
2026-09-29 14:19:30
发现一个奇怪的现象:你吼了孩子,孩子敢顶嘴,说明你这个家庭还有救;如果你不停对孩子吼叫谩骂,孩子一声不吭沉默寡言,那你家庭没救了

发现一个奇怪的现象:你吼了孩子,孩子敢顶嘴,说明你这个家庭还有救;如果你不停对孩子吼叫谩骂,孩子一声不吭沉默寡言,那你家庭没救了

阿呆爸
2026-09-27 21:04:44
骗财骗色、被开除军籍,传了二十年的黑料,原来我们全都被骗了

骗财骗色、被开除军籍,传了二十年的黑料,原来我们全都被骗了

史之韵
2026-09-28 18:12:43
汶颂第四棒超级位移热血生吃小池祐贵 韩国被判犯规!泰国递补摘铜

汶颂第四棒超级位移热血生吃小池祐贵 韩国被判犯规!泰国递补摘铜

劲爆体坛
2026-09-28 23:27:22
北京野生动物园举办抓“毛毛虫”大赛,两天抓了21斤、7万条

北京野生动物园举办抓“毛毛虫”大赛,两天抓了21斤、7万条

新京报
2026-09-29 20:08:13
2026-09-29 23:16:50
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
10022文章数 569关注度
往期回顾 全部

科技要闻

82亿美元收购!李飞飞将与苏姿丰并肩做AI

头条要闻

"将儿子独留出租房"母亲质问房东:你的目的是为了什么

头条要闻

"将儿子独留出租房"母亲质问房东:你的目的是为了什么

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

央行调整完善若干货币政策工具

汽车要闻

搭华为乾崑ADS 5/设计风格换新 2027款纵横G700售30.49万起

态度原创

房产
本地
健康
时尚
公开课

房产要闻

山海悦·壹号院喜封金顶 第五代住宅重塑自贸港人居新标杆

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

洗脸越勤,痘痘反而越多?

早秋外套不用买太多太贵,准备几件长风衣,洒脱高级又百搭

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版