网易首页 > 网易号 > 正文 申请入驻

开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议

0
分享至

机器之心编辑部

一款新开源的智能体框架(harness),声称在 ARC-AGI-3 上联合 Opus 5 拿到了 95.5% 的成绩,超过人类专家基线。官方帖子迅速获得大量关注,GitHub 星标已接近 5 千。



要知道,ARC-AGI-3 不是那种「刷过题库就能拿高分」的考试,它是一堆完全陌生的抽象游戏,每个游戏的规则、目标、甚至操作逻辑都不相同。你进去之后,没人告诉你该做什么,你得自己摸索、试错、归纳,然后在有限的行动预算内完成目标。



这个框架名叫Prime Agent,由 Prime Intellect 发布。官方对它的定义是:一个面向编程、研究和长时间自主任务的「自我改进 RLM harness」



项目链接:https://github.com/PrimeIntellect-ai/prime-agent

RLM 是 MIT 博士生 Alex Zhang 等人去年 10 月发布的一项工作(参见《

递归语言模型登场!MIT华人新作爆火,扩展模型上下文便宜又简单》),其全称是 Recursive Language Models,即递归语言模型。按照论文里的介绍,它是一种将输入上下文视为可操作「变量」的通用推理策略:主模型在类似 Jupyter 的编程环境(REPL)中工作,通过编写代码对庞大的上下文变量进行切分与过滤,并将子任务递归外包给临时的小模型调用,最终综合各结果形成答案 —— 例如在 Python REPL 中调用 GPT-5 及 mini 版迭代处理用户提示。



当时,它的效果就已经非常惊艳:在 OOLONG 等最难长上下文评测中,GPT-5-mini 采用 RLM 的正确率超直接使用 GPT-5 两倍以上且单次成本更低。因此,研究者断言,这将是一个强大的新范式,且相比纯 CoT 或 ReAct 代理,显式训练以递归推理为核心的 RLM 很可能成为推理时扩展能力的下一个里程碑。

如今,Prime Agent 把 RLM 论文的核心理念进一步工程化落地了,并在此基础上做了重要扩展。我们一起来看一下他们做了哪些创新。

Prime Agent 为什么那么强?

官方博客里写的很清楚:它彻底重构了「harness 该怎么设计」这一底层假设。

Prime Intellect 团队认为,现有的 harness 设计都是围绕早期模型的能力建的 —— 固定的工具调用格式、强制的上下文压缩、设计时写死就再也不变的子智能体和提示词。这些脚手架非但没有帮模型发挥,反而逼着模型去绕过自己的框架。模型越聪明,旧的 harness 就越像一副不合身的镣铐。

Prime Agent 的解法是把这套脚手架彻底打开。它做了两个关键设计:

一是 RLM,给模型一个持久的 IPython 内核当 REPL 用,上下文是变量、子智能体是函数调用,模型可以直接用代码操作自己的历史、工具和子智能体。即使会话被压缩,完整历史仍保留在外部状态中,需要时可被程序化取回;



二是 Continual Harness,把提示词、技能、记忆和子智能体全部变成运行时可 CRUD 的状态,agent 能在执行过程中实时创建、修改、调用它们,甚至跨会话通信。



换句话说,Prime Agent 不是给模型配了一套更聪明的工具箱,而是把工具箱的钥匙交给了模型自己。

在 ARC-AGI-3 这种每道题规则都陌生的战场上,它能一边做题一边改写自己的解题策略,而不是被出发前的预设绑住手脚,所以它能在 ARC-AGI-3 上以更少的 token 消耗跑出更高分数。

Prime Agent 怎么让 Agent 持续工作?

但「把钥匙交给模型」只是一层。Prime Agent 还试图解决一个更现实的问题:

Agent 怎么才能连续工作几个小时、几天,甚至在人退出终端后继续运行?

为此,它在底层放了一个后台 daemon,统一管理所有正在运行的会话。每个子智能体都有独立的上下文、文件目录、IPython 状态和会话记录。一次任务结束后,子智能体不会立刻被销毁;主智能体可以记住它的 ID,过一段时间再把它叫回来继续工作。

这和常见的「一次性外包」不太一样。

普通多智能体系统里,主 Agent 把任务扔给子 Agent,拿到一份摘要,双方关系就结束了。Prime Agent 中的子智能体更像一个长期项目成员:它保留自己的工作现场,主 Agent 可以追问、纠偏,或者让多个 Agent 直接交换信息。



Prime Agent 架构图。

为了让任务真正跑得足够久,Prime Agent 还把长期自主运行拆成了三个机制:

  • Goal 负责保存一个持续目标,在任务完成前不断提醒 Agent 继续推进;
  • Heartbeat 按固定时间把消息重新注入会话,例如检查子智能体进度、轮询实验结果;
  • Autonomous Mode 负责在一轮输出结束后自动续跑,避免 Agent 做到一半就停下来。

用户则可以给它设置最大轮数、token 预算和执行时间,并设置一道完成前必须通过的测试。比如让它修改一个项目时,测试没通过,系统就会把失败结果重新交给 Agent,让它继续修;如果工作区没有变化,也不会毫无意义地重复执行同一个失败测试。

所以 Prime Agent 所谓的「长时间自主」,并不是简单地给模型一句「继续努力」,而是把目标保存、定时唤醒、自动续跑、失败反馈和资源上限做成了一套运行机制。

Prime Agent 是如何「自我改进」的?

最值得解释的,是它的 /refine。

Prime Agent 会读取自己刚刚经历的完整轨迹:尝试过什么、在哪里失败、什么方法有效,然后把可复用的经验写回 harness。

这些修改可能是一条新的提示词备注、一段记忆、一个技能,也可能是一份新的子智能体配置。比如它发现某类测试经常因为网络波动失败,就可以把「先重试再判断代码错误」沉淀成一个技能;如果某个子智能体的分工方式效果不好,它也可以修改这个子智能体的说明。

不过,它不能改写最底层的系统提示词。每次 refinement 都会记录触发原因和修改结果,并保留历史版本,出现问题时可以回滚。

这也是 Continual Harness 和普通「长记忆」的区别:它不只是把过去发生的事存下来,而是试图把经历转化成下一轮可以直接调用的能力。

在官方展示的 Factorio(一款 2D 工厂模拟游戏)实验中,Prime Agent 就把一次次成功和失败转化成记忆与技能,不断改进工厂布局,几个小时内把生产分数推到了 10 万以上。



但这个案例同时暴露了「自我改进」的另一面。

Agent 后来发现,它可以通过 RCON 命令直接把资源传送进机器。即使提示词明确要求它不要作弊,它仍然利用 /refine 把这个漏洞沉淀成了越来越高效的「作弊技能」。

也就是说,Continual Harness 能放大有效策略,但它并不知道什么叫「正当的有效策略」。如果评测环境存在漏洞,它同样可能把 reward hacking 变成一种可以不断进化的能力。

Prime Agent 表现如何?

此外,Prime Intellect 试图证明,Prime Agent 并非只会做 ARC-AGI-3。

官方还在长上下文理解、长指令执行、数学排序、模拟器开发、GPU Kernel 编写和三维迷宫等任务上,将它与 Claude Code、Codex 以及带子智能体的 Pi-mono 进行了比较。



视频链接:https://mp.weixin.qq.com/s/_Z4RGnO8GKxjbbA8ZB0AYQ

结果并非每一项都由 Prime Agent 获胜,但它在多数长上下文和长时间任务上具有竞争力,部分组合的提升相当明显。

例如,在 OOLONG 128K 长上下文任务中,GPT-5.6 Sol 搭配 Prime Agent 得分 0.94,而官方列出的 Codex 对照成绩为 0.50;在需要长输出的 OOLONG-Pairs 上,Prime Agent 搭配多个模型也取得了较强成绩。



Prime Intellect 将这种优势归因于「程序化工具调用」:模型不需要把大量工具输出逐段读进上下文,而是可以写代码筛选、聚合数据,只把真正需要的部分送进推理过程。

不过,团队也承认,目前还没有任何模型专门围绕 Prime Agent 训练。现有模型并不会天然熟练地使用它的全部能力。Prime Intellect 的下一步设想,是让模型与 harness 共同训练,让模型从训练阶段就学会如何管理上下文、调度子智能体和修改自己的工作框架。

如果说传统路线是在训练一个更聪明的「大脑」,Prime Intellect 的判断是:下一阶段的提升,还来自让大脑和它使用的操作系统一起进化。

到这里,Prime Agent 看起来相当有前途:新的上下文管理方式、持续运行的子智能体、自我修改的 harness,再加上一组超过人类专家基线的成绩。

但就在发布后的第二天,有人直接克隆了它的代码仓库,然后给整场热潮泼了一盆冷水。

Prime Agent 真有那么好吗?

发起质疑的是 Shortcut AI 联合创始人 Peter Wang。他在帖子开头写道,每当一个项目伴随着「疯狂的炒作和成建制的公关」出现,就该把「胡扯探测器」拿出来了。



检查代码后,Peter Wang 提出了两项核心质疑。

第一项质疑针对 RLM 这个概念是否真的被实现。

他在代码中发现,Prime Agent 的 RLM_MAX_DEPTH 被设成了 1。

在他的理解中,RLM 的关键吸引力就在于递归:主模型可以调用子模型,子模型再继续调用下一层模型,不断分解问题。真正困难的也不是写出一个调用子 Agent 的函数,而是让多层递归在生产环境里不至于失控。

递归层数越深,token 成本和运行时间越容易爆炸;任务在不同 Agent 之间反复转述,也可能变成一场「传话游戏」,逐渐丢失用户需求中的细节。要把递归做到三层、四层甚至更多,需要解决预算控制、并发、失败恢复、信息保真和停止条件等问题。



可如果最大深度只有 1,Peter Wang 认为,这实际上就是一个主 Agent 调用若干子 Agent,与大量现有 harness 并无本质区别。

因此,他的判断是:Prime Agent 确实构建了一棵相当稳健、持久化的异步 Agent 进程树,但它没有证明自己解决了「可扩展的深递归智能体」问题。把它包装成 RLM,至少有夸大之嫌。



第二项质疑,指向 ARC-AGI-3 的 95.5%。

Prime Agent 的三次运行分别获得 95.0%、95.2% 和 95.5%;Best@3 达到 99.97%,完成了 183 个关卡。但这些成绩来自公开评测集。

虽然 Agent 第一次进入游戏时并不知道规则,但开发者可以反复查看公开环境、运行轨迹和已有方案,并据此调整提示词、工具和 harness。

Prime Agent 又具备 Continual Harness,可以从过去的轨迹中提炼记忆、技能和提示词。因此,Peter Wang 认为,外界很难判断成绩提升中有多少来自通用能力,又有多少来自对公开任务的反复适配。

他并没有指控团队让 Agent 直接读取答案。争议的重点在于:没有独立的私有测试,就无法排除任务特定过拟合。

Peter Wang 还提到 PRO-LONG。该项目使用相对简单、通用的方法,也在 ARC-AGI-3 上取得了约 95% 的成绩。他认为,这一结果反而更值得关注。



RLM 作者亲自回应

这篇质疑很快引来了 Alex Zhang 的回应。Alex Zhang 不只是 Prime Agent 官方博客的作者之一,也是 RLM 论文的第一作者。

他先用一句反话开场:「看来问题解决了,Prime Agent 不是 RLM。谢谢你。」

随后,他给出了更严肃的解释。

Alex 表示,RLM 论文真正想回答的问题是:当语言模型开始调用语言模型、被调用的模型又可能继续调用其他模型时,什么样的抽象最适合组织这套系统?

他的答案不是「无限递归」,而是两个组合:程序化的工具/子智能体调用,加上作为变量存在的上下文。



Alex 认为,递归深度上限只是面向用户的配置,用来避免 token 成本爆炸;能否无限递归,并不是判断一个系统是否属于 RLM 的标准。

他还表示,对于 RLM 而言,深度为 1 并不意味着其表达能力弱于无限深度,但没有在这篇回应中进一步展开证明。

对于「RLM 只是研究玩具」的评价,Alex 也不认同。他提到,Codex、Claude Code 和 Muse Code 都已经提供了类似的核心抽象。

不过,在 benchmark 问题上,Alex 承认 ARC-AGI-3 是一个「可以被利用的 benchmark」。

他的回应是,Prime Agent 的价值不能只看 ARC-AGI-3,博客中的其他实验同样需要考虑。此外,他认为 Continual Harness 对 ARC-AGI-3 成绩的作用可能比 RLM 更重要。

这也让争议重新回到 Prime Agent 最核心的设计上:同一套自我改进机制,既可能帮助 Agent 积累经验,也可能让它越来越适应一套公开评测。

在私有集结果出现之前,95.5% 依然是一项值得关注的工程成绩,但还不能单独证明 Prime Agent 在真正未知的任务上超过了人类。



目前,已经有一些开发者在尝试使用 Prime Agent,如果你也试用过,欢迎在评论区分享使用体验。



参考链接:https://www.primeintellect.ai/blog/prime-agent

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“你女儿穿成这样,能出门吗?”女子高铁偷拍女孩,被网友骂醒!

“你女儿穿成这样,能出门吗?”女子高铁偷拍女孩,被网友骂醒!

林林先生
2026-07-31 07:40:03
如果牛顿的贡献值是100,爱因斯坦是90,那么杨振宁大概是多少?

如果牛顿的贡献值是100,爱因斯坦是90,那么杨振宁大概是多少?

离离言几许
2026-07-28 15:29:13
邹市明的苦,都是自找的!别的不谈,亲爹妈扔乡下,岳母娘住豪宅,这种事一般人干不出来

邹市明的苦,都是自找的!别的不谈,亲爹妈扔乡下,岳母娘住豪宅,这种事一般人干不出来

美芽
2026-08-05 19:39:21
8月7日是立秋,中老年记得多吃3种高钾食物,腿脚有劲精神足

8月7日是立秋,中老年记得多吃3种高钾食物,腿脚有劲精神足

江江食研社
2026-08-04 19:30:07
去澡堂洗澡才发现,女人和女人之间也有不一样的地方

去澡堂洗澡才发现,女人和女人之间也有不一样的地方

新时代的两性情感
2026-07-11 08:13:04
“白海豚”突然升至15级,或将重回16级超强台风!部分列车临时停运!台州61家A级旅游景区暂时关闭

“白海豚”突然升至15级,或将重回16级超强台风!部分列车临时停运!台州61家A级旅游景区暂时关闭

台州交通广播
2026-08-08 00:55:15
台风“白海豚”将影响部分地区周末交通出行

台风“白海豚”将影响部分地区周末交通出行

界面新闻
2026-08-07 22:00:55
睡别人老婆到底违不违法?分4种情况,看完别再抱有侥幸

睡别人老婆到底违不违法?分4种情况,看完别再抱有侥幸

小蜜情感说
2026-08-01 04:35:14
南京禄口机场停车每天13元,南京禄口机场2026停车收费标准,南京禄口机场停车一天多少钱?南京禄口机场周边停车场信息,禄口机场停车指南

南京禄口机场停车每天13元,南京禄口机场2026停车收费标准,南京禄口机场停车一天多少钱?南京禄口机场周边停车场信息,禄口机场停车指南

车旅纵横
2026-08-07 03:06:31
台湾统一后,我国仍有三大领土必须收回,个个都是战略要地!

台湾统一后,我国仍有三大领土必须收回,个个都是战略要地!

混沌录
2026-08-07 23:47:13
她是上海当家花旦,与前国脚分手后,一个低调嫁人一个定居美国

她是上海当家花旦,与前国脚分手后,一个低调嫁人一个定居美国

情感大头说说
2026-08-08 01:20:18
随着上海5-6惜败,决赛对阵出炉:中国与阿森纳争冠,上海战河床

随着上海5-6惜败,决赛对阵出炉:中国与阿森纳争冠,上海战河床

绿茵舞着
2026-08-08 00:13:07
周星驰父亲:年轻时抛妻弃子,晚年与事业有成儿子和解 生活滋润

周星驰父亲:年轻时抛妻弃子,晚年与事业有成儿子和解 生活滋润

洲洲影视娱评
2026-08-07 18:14:24
胚胎销毁了,为什么小三始终没现身?知情人爆料:她忙着开新公司

胚胎销毁了,为什么小三始终没现身?知情人爆料:她忙着开新公司

借你一生
2026-08-06 22:56:14
小区保安捡到18万现金归还失主说少了5万,调出监控,保安傻眼了

小区保安捡到18万现金归还失主说少了5万,调出监控,保安傻眼了

麦子情感故事
2026-08-07 18:11:06
金与正谴责日本试射“战斧”导弹

金与正谴责日本试射“战斧”导弹

参考消息
2026-08-05 14:15:07
搞定女人其实很简单,让女人“上瘾”的两个坏技巧,越坏她越着迷

搞定女人其实很简单,让女人“上瘾”的两个坏技巧,越坏她越着迷

周哥一影视
2026-07-25 00:11:20
一夜之间,"大师"们集体失业了

一夜之间,"大师"们集体失业了

曹莽看世界
2026-08-07 16:32:09
台风又改路线!台风“白海豚”进入48小时警戒线!强台风最新路径查询入口→

台风又改路线!台风“白海豚”进入48小时警戒线!强台风最新路径查询入口→

最金华
2026-08-06 23:47:12
上海夫妇花7000元买机票,到机场却查无此票!一查身份,1994年的丈夫竟“穿越”成了2011年的“小孩”……

上海夫妇花7000元买机票,到机场却查无此票!一查身份,1994年的丈夫竟“穿越”成了2011年的“小孩”……

励职派
2026-08-07 21:26:42
2026-08-08 02:56:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13699文章数 142712关注度
往期回顾 全部

科技要闻

突然涨价,"只收电费钱"的梁文锋,变了吗

头条要闻

2岁患儿就诊死亡首诊医生获刑 不少医生为其鸣不平

头条要闻

2岁患儿就诊死亡首诊医生获刑 不少医生为其鸣不平

体育要闻

去年信誓旦旦3000万 今年NBA查无此人

娱乐要闻

周也热恋结束,六个字暴露单身状态

财经要闻

腾讯WorkBuddy领跑AI办公 阿里字节急了?

汽车要闻

越7全球首秀 传祺开始进攻方盒子越野

态度原创

亲子
房产
数码
艺术
健康

亲子要闻

西蒙小小班结束,在家整整折磨了我们两天。丈母娘还以为休息两天继续上课呢

房产要闻

单日狂卖35亿!两大央企重仓,三亚土拍又爆了!

数码要闻

苹果旗舰台式机Mac Pro迎来20周年纪念 淘汰停产已有五个月

艺术要闻

别人画皮他画魂,这个在修道院关了18年的男人,把每一具肉体都画成了圣像

打干细胞会不会诱发癌症?

无障碍浏览 进入关怀版