网易首页 > 网易号 > 正文 申请入驻

阿里开源LoopArena,比拼五大模型Loop Engineering能力!海外博主直呼「太需要了」

0
分享至

智猩猩AI整理

编辑:知知

代码已经交给 Agent 写了,开发者却还得守在一旁:看进度、补要求,再时不时追问一句「接下来呢?」

最近,Loop Engineering在 AI 开发者中热了起来。它要做的,就是把这份持续安排工作的职责也交给系统:人来确定目标和要求,由 Loop 根据执行反馈,组织 Agent 一轮轮往下做。

那么,负责控制这个 Loop 的模型,该选谁?

阿里巴巴 DreamX 团队开源的LoopArena,把这个问题变成了一项专门的 Benchmark。

GPT、Claude、DeepSeek 等五个模型同台,执行编程的 Agent 保持不变,比较的正是模型在长程 Loop 中的控制能力。

这项工作论文登上 Hugging Face Daily Papers 当日榜首。


Daily Papers 主理人Ahsen Khaliq(AK)随后在 X 上分享了这项工作。DAIR.AI、Rohan Paul 等海外 AI 媒体和博主也迅速跟进。


海外博主Shashank Ashtikar在转发 DAIR.AI 的介绍时直言:“太需要这样的工作了!”


他认为,许多组织和团队已经在交付 Loop,却一直缺少真正评估它们的办法。看到 LoopArena,他的评价很直接:“太棒了!”

另一位博主 Brain Cramps 则把 LoopArena 列入了自己整理的「将影响 AI 领域的七件事」


从 Terminal-Bench 4.0 到 DeepSWE,最近的新模型发布,越来越看重 Agent 处理复杂任务的表现。榜单值得看,跑榜的账单也不轻:仅在 Terminal-Bench 4.0 的公开榜单上,就有多组评测记录的总费用达到数千美元,个别接近一万美元

针对 Loop 中的下一步控制决策,LoopArena 则准备了轻量的 Type I 评测,无需在评测时重新运行 Coding Agent。按其 arXiv 论文公布的结果,一个模型测完整套 Type I,估算模型调用成本最低只需 0.31 美元。

上手也很轻便:环境和模型接口准备好后,跟着仓库里的快速示例,5 分钟即可上手 Type I 评测。



  • 论文题目:

    LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering

01

从写 Prompt,

到设计持续工作的 Loop

过去,开发者和 Coding Agent 的配合,常常是一问一答。交代任务,检查结果,再决定下一句该怎么说。Agent 负责写代码,人负责把整个过程往前推。

Addy Osmani 在讨论 Loop Engineering 的文章中,将开发者的职责描述为设计一套能持续给 Agent 安排工作的系统。人确定目标和验收要求,Loop 根据运行反馈接着安排工作。

比如,要给一个已有项目增加新功能。前期需要找对实现位置;功能写好后,要检查它是否影响原有行为;到了交付前,还要确认验证结果覆盖了任务要求。同一个目标,推进到不同阶段,需要的下一步并不相同。

这些判断需要跟着代码和运行反馈更新。就好比一位技术负责人(Tech Lead),要看懂当前进展,判断接下来该推进实现,还是先补上验证。

LoopArena 关注的,就是模型在这个位置上究竟表现如何。

已有的编程评测让我们了解一套 Coding Agent 完成任务的能力。LoopArena 将其中的外层控制单独拿出来比较,让研究者可以有针对性地评测负责这一角色的模型。

对于已经在搭建 Agent 工作流的团队,这样的比较很实用。选哪个模型来负责后续安排,设计的控制策略有没有效果,都可以放进同一套评测里检验。

02

同一个 Coding Agent,

五个模型轮流指挥

研究者将编程执行与外层控制解耦:负责读代码、修改仓库、运行测试的 Coding Agent 称为Worker;在长程 Loop 中读取进展、决定后续安排的模型称为Controller。后者是 LoopArena 要评测的对象。

在模型对比中,团队固定 Qwen3.7-Plus 作为 Worker,同时统一工具、任务环境、执行预算与评测方式,只更换 Controller。


图 1|LoopArena 论文主原理图。Controller 根据运行反馈指导 Worker,任务结果由统一的评测器检验。

这套分工在运行时很直观。Worker 完成一轮工作后,系统会整理进展和相关执行记录,交给 Controller。Controller 据此决定下一轮要推进什么、需要补充哪些验证,或者是否可以结束。

如果继续工作,它就给 Worker 一份具体安排。论文称之为 Loop Contract:说明下一轮的目标、要保留的已有行为,以及完成这一轮的条件。新的执行结果回来后,Controller 再作判断。

Controller 不直接改代码,它的决策通过 Worker 落地。上一轮安排带来了什么结果,下一轮还要根据反馈调整。在这样的连续交互中,模型指导任务的表现就可以被观察和评测。

任务结束时,评测器检查实际代码与行为。这让控制决策和最终任务结果联系起来,模型给出的建议也有了执行层面的检验。

这种固定 Worker、比较 Controller 的做法,也让 X 用户 cixier 留下了一句直白的评价:“Worker 锁死、只考 Controller,这才像在测 agent。”

首批评测覆盖 GPT-5.5、Qwen3.7-Plus、Claude Opus 4.8、DeepSeek-V4-Flash 和 GLM 5.2。

在完整任务评测中,GPT-5.5 排名第一,Qwen3.7-Plus 紧随其后。完整成绩和实验设置已经公开,社区可以沿用这套条件,接入自己的模型进行比较。

03

从下一步决策,

到完整任务,都能测

一次控制判断和一整段连续工作,可以放在不同的评测中考察。LoopArena 设计了三类评测,让研究者按自己的问题选择投入。

Type I:下一步,怎么选?

模型阅读一个控制点的任务进展,从候选指令中选择接下来的安排。题目的答案有实际执行结果作依据:在构建基准时,团队已经运行过候选方案,比较了它们带来的后续结果。

等到评测新模型时,这部分执行不必重做。模型只需完成控制决策,就能得到成绩,适合快速考察下一步判断。

Type II:从中途接手,继续往下带。

评测从准备好的中间状态开始,让 Controller 指导 Worker 完成接下来的一个阶段。代码会真实执行,反馈也会持续更新,多轮控制的过程保留在这段工作里。

研究者可以直接观察模型如何应对运行中的新情况,不必为每次尝试都重复前面已经完成的开发工作。

Type III:从开始到交付,全程参与。

任务从原始仓库状态启动,覆盖调查、实现和验证,直到决定结束。Controller 要根据整个过程的进展持续安排工作,最后接受完整任务的验收。


图 2|LoopArena 论文原图。单次决策、任务切片与完整任务,分别对应不同的研究需求和评测投入。

04

想研究长程控制,

预算也能更从容

对学生和小团队来说,长程 Agent 研究有个很实际的门槛:一个新想法,往往要等整套任务跑完,才能知道有没有效果。模型调用的账单也跟着每一轮尝试增加。

LoopArena 的 Type II 为此提供了一个低成本入口。它取自对应的完整任务,并与 Type III 一一配对,让团队可以直接检查:少跑前面一段,能否仍然得到有参考价值的模型比较?

在论文实验中,Type II 的平均估算模型推理成本比配对的完整任务降低约六成,同时,模型排序与完整任务评测高度一致。

这对日常研究意味着,可以先用任务切片比较不同模型、尝试新的控制方法,再把选中的方案放到完整任务上评测。同一份预算,就有机会支持更多轮想法验证。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
多枚导弹直扑美军航母,美方承认低估了伊朗:他们已不再忌惮美国

多枚导弹直扑美军航母,美方承认低估了伊朗:他们已不再忌惮美国

锅锅爱历史
2026-09-07 17:55:59
伊朗突然亮出最高机密,美国才明白:难怪打了这么久都打不垮

伊朗突然亮出最高机密,美国才明白:难怪打了这么久都打不垮

热点一网打尽
2026-09-06 18:52:42
9月6日,人社部、财政部关于2026年上调退休人员基本养老金的通知尚未公布,但是有退休人员突然收到了172.12元,这是怎么回事呢?

9月6日,人社部、财政部关于2026年上调退休人员基本养老金的通知尚未公布,但是有退休人员突然收到了172.12元,这是怎么回事呢?

白昼说故事
2026-09-06 09:50:59
蒙古扛不住了,公开喊话中国,希望中国不计前嫌帮蒙古一把

蒙古扛不住了,公开喊话中国,希望中国不计前嫌帮蒙古一把

闻香阁
2026-09-07 14:30:10
讣告--赵亚洲

讣告--赵亚洲

中国青年摄影
2026-09-06 22:50:50
陈毅开玩笑问算命人:我能不能当皇帝?没想到竟让算命人送了命

陈毅开玩笑问算命人:我能不能当皇帝?没想到竟让算命人送了命

历史人文2
2026-08-24 13:30:03
意难平!《伪装者2》全员大换血,有些经典真的很难超越

意难平!《伪装者2》全员大换血,有些经典真的很难超越

小椰的奶奶
2026-09-07 18:25:18
江西女孩执意去香港看演唱会,全家低保被取消,家人哭诉没了经济来源生活无望

江西女孩执意去香港看演唱会,全家低保被取消,家人哭诉没了经济来源生活无望

Mr王的饭后茶
2026-09-06 14:25:17
曹德旺当年反对女儿嫁给厦大高材生,理由只有一句:他太优秀了!14年后,这个女婿拿到的不是聘书,而是福耀的一份重任

曹德旺当年反对女儿嫁给厦大高材生,理由只有一句:他太优秀了!14年后,这个女婿拿到的不是聘书,而是福耀的一份重任

背包旅行
2026-09-03 15:48:21
联赛第一!联赛第四!20球8助攻,中超最强外援或可助国足冲击世界杯

联赛第一!联赛第四!20球8助攻,中超最强外援或可助国足冲击世界杯

大卫的篮球故事
2026-09-07 17:34:41
江西一女生赴港看演唱会被取消全家低保?律师:若属实于法有据,但行政比例原则有讨论空间

江西一女生赴港看演唱会被取消全家低保?律师:若属实于法有据,但行政比例原则有讨论空间

封面新闻
2026-09-06 18:22:09
“不缺吃不缺喝,你长成这样给谁看?”新生开学后,妈妈受不了了!

“不缺吃不缺喝,你长成这样给谁看?”新生开学后,妈妈受不了了!

林林先生
2026-09-06 17:03:04
日本人预测:未来35年将出现5大强国,日本屈居第二,那中国呢?

日本人预测:未来35年将出现5大强国,日本屈居第二,那中国呢?

经纬戎韬
2026-09-06 00:46:23
12战11胜!击败王星昊、辜梓豪、丁浩!此棋手为何一夜开窍?

12战11胜!击败王星昊、辜梓豪、丁浩!此棋手为何一夜开窍?

人工岛分布
2026-09-07 14:30:31
罗志祥复出登上热搜,《极限挑战》导演发布长文:六人齐聚才是极限挑战,并询问观众是否期待重拍

罗志祥复出登上热搜,《极限挑战》导演发布长文:六人齐聚才是极限挑战,并询问观众是否期待重拍

新浪财经
2026-09-05 12:05:31
浙江一辆12年车龄的奔驰S600L拍卖,14人报名竞买,以近28万成交

浙江一辆12年车龄的奔驰S600L拍卖,14人报名竞买,以近28万成交

华庭讲美食
2026-09-07 08:49:28
死在加州路边的阿里总监:42岁,年薪百万,却买不到一张回程机票

死在加州路边的阿里总监:42岁,年薪百万,却买不到一张回程机票

椰青美食分享
2026-09-06 13:13:24
中超最神奇球队!云南玉昆7项数据中超第一:目标三年内进亚冠

中超最神奇球队!云南玉昆7项数据中超第一:目标三年内进亚冠

邱泽云
2026-09-07 15:47:38
韩国男排2-3惜败,翻盘未果!亚锦赛同组劲旅2连胜,提前出线

韩国男排2-3惜败,翻盘未果!亚锦赛同组劲旅2连胜,提前出线

刘笤说体坛
2026-09-07 18:24:39
大开眼界!许家印当年奢靡生活曝光

大开眼界!许家印当年奢靡生活曝光

麦杰逊
2026-08-23 15:09:25
2026-09-07 19:04:49
智猩猩
智猩猩
AI 技术内容与服务平台
72文章数 3关注度
往期回顾 全部

科技要闻

华为Mate XT 2起售价19999元 9月12日开售

头条要闻

吴彦祖谈CHINA GT事故:赛会方36小时后发声明是可耻的

头条要闻

吴彦祖谈CHINA GT事故:赛会方36小时后发声明是可耻的

体育要闻

中超争冠形势:成都蓉城下轮打平夺冠

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

房产
旅游
艺术
公开课
军事航空

房产要闻

10万人吃瓜!三亚这个楼盘,法拍网上卖疯了!

旅游要闻

百名文旅推介官启程、导游夜校开班,苏州开启文旅人才队伍专业化系统化常态化培育新征程

艺术要闻

这是500年来“最美行书”,比赵孟頫的字还漂亮,启功:能看一眼都是福气!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

媒体:中美战区司令会晤释放的信号 台湾要听懂

无障碍浏览 进入关怀版