网易首页 > 网易号 > 正文 申请入驻

第一篇AI4AI综述:让AI改进AI,发展到哪步了?

0
分享至


新智元报道


从long horizon智能体到recursive self-improvement:从「AI 能做什么」出发,进一步追问「Can AI improve AI?」——AI能否可靠地改进AI,并让进步持续积累?

让AI写一段代码,已经是许多人熟悉的工作方式。如果把任务换成「帮我做出一个更好的AI」,它能完成吗?

这意味着AI要提出方案、修改代码、运行实验、判断结果,再把有效的改进留下来。最诱人的前景是:这一轮变强的系统,还能帮助下一轮做得更好。

围绕这个问题,第一篇AI4AI综述论文梳理了数百项研究,将long horizon智能体、AI4AI和recursive self-improvement放进同一张研究地图。


论文链接:https://www.preprints.org/manuscript/202608.2108

资源主页(GitHub Pages):https://kaiwu5.github.io/Awesome-AI4AI/

项目介绍 / Blog:https://simpleagentlab.com/ai4ai

Harness(RSIHub):https://github.com/simple-agent-lab/RSIHub

这篇综述的主要发现是:AI已能在明确的目标和评价规则下承担不少研发工作,但单项能力的提升,还不能保证完整研发流程可靠,更不能证明系统能够持续自我改进。

这道「会做某一步」与「能把整件事做成」之间的缺口,被论文概括为composition gap(组合鸿沟)。对于希望用AI加速研发的人来说,找出这道缺口在哪里,才能判断下一步应该改进模型、工具、记忆,还是检验结果的方式。


图 1|从「会用工具」到「完成AI研发」,中间还需要哪些能力?论文把评测任务、任务难度、模型和运行框架放在一起考察。

为什么开始讨论AI改进AI

AI4AI是AI for AI的缩写,可以理解为「用AI帮助研发更好的 AI」。它能改进的对象很多:训练数据、模型本身、运行工具、评测方法,甚至研发流程。

如果这件事能够可靠地完成,研究人员就有机会把一部分精力从重复的实现、试验和排错中释放出来,更快地检验新想法。问题也随之出现:AI完成了工作,是否就意味着它作出了正确的研究判断?

以优化训练流程为例,AI可以修改数据处理代码,再启动训练。但指标涨了,可能来自有效的改进,也可能来自比较条件改变,或者模型过度适应了某套测试。看起来「做完了」,距离证明「变好了」,还隔着验证。

综述因此区分了几个常被放在一起的概念。AI 优化一个独立模型,属于 AI4AI;当它修改的是自身组件,才涉及自我改进。进一步走向 recursive self-improvement(递归式地改进自身),还需要让「构建下一代系统的过程」本身可以被改进,并检验收益能否传递到后续版本。

这些概念帮助我们分清:系统到底改了什么,以及结果究竟证明了什么。

这篇综述如何梳理研究

论文将分散在智能体、自动化AI研发和自我改进等方向的研究连接起来,同时考察两类测试:一类单独检查检索、编程、工具调用等能力;另一类要求系统完成工程、优化、论文复现等完整研发任务。

阅读每项工作时,综述追问五件事:改进对象是什么,是否改到自己,谁控制目标与各个环节,凭什么判断成功,以及改进能否被保留和迁移。

由此,三个容易混淆的问题被分开:任务有多难、AI有多少决定权、改进证据有多充分。运行时间长,不一定代表任务难;自动执行了所有步骤,也不一定代表目标和判断标准由AI决定。


图 2|一次AI改进要经历计划、执行、反馈和修复。评估时还需分别判断:改了谁,谁作决定,为什么可以相信结果。

发现一:每一步都能做,连起来仍可能失败

一次AI研发,可能从查资料开始,经过提出假设、修改代码、运行实验,最后形成结论。这些步骤需要共享同一个目标,也需要使用彼此产生的证据。

麻烦往往出在交接处。比如,代码已经更新,分析时却用了上一轮的日志;实验指标看似提高,报告中的对照组却采用了另一套配置。单看每项操作,都像是在推进工作;把它们连起来,结论却可能失去依据。

这就是composition gap的重要含义:检索、编程和工具调用的单项成绩,不能直接当作完整研发能力的证明。

综述强调,long horizon的关键在于前一步会影响后一步。一个早期选择可能改变后续能够采取的行动,一个错误可能直到训练结束后才暴露。系统需要记住关键状态,理解反馈来自哪次尝试,再据此修正计划。

因此,只看运行了多久、调用了多少次工具,还不足以判断能力。更有价值的问题是:它能否在步骤相互依赖、结果延迟出现时,仍然把目标、版本和证据保持一致?

对于开发者,如果单项测试过关,完整流程仍然失败,就值得检查最早在哪一次交接中丢失了关键信息,而不只是继续提高单项分数。

发现二:会执行,不等于掌握整个研究过程

综述观察到,AI 正承担更多规划、编程、实验和修复工作,但人类通常仍在决定研究目标、评价标准,以及什么结果可以被接受。

这一区别很重要。让系统按既定规则优化某个指标,与让它独立判断哪个问题值得研究、什么证据足以支持结论,需要的能力并不相同。

要让AI承担更完整的流程,论文从两侧梳理改进方向。一侧是模型:学会规划、正确使用工具,并从较长的行动过程与反馈中学习。另一侧是Harness,即组织智能体运行的工具、记忆、执行和检查机制。


图 3|模型侧的改进路径。让系统学会做计划,把计划落实为行动,再利用反馈改善后续策略。

Harness 可以理解为研发现场的配套设施:保存实验记录,核对执行结果,遇到问题时恢复,判断何时停止或请人处理。模型和这些机制一起工作,才有机会让一次研发从开头可靠地走到结尾。

这也影响我们如何阅读评测成绩。同一个模型,换一套工具、增加重试次数或允许更多人工帮助,结果都可能变化。比较时应说明预算、工具、评估方式和人工介入条件,才能知道提升来自哪里。

发现三:一次涨分,距离持续变强还有多远

当一个系统报告「改进成功」,最直观的证据是指标提高了。但综述认为,至少还要分开看四件事。

  • 真的提高了吗?Measured Gain:在声明的指标上,是否测到了实际增益?

  • 提高能保住吗?Retention:继续迭代之后,收益是否仍然存在?

  • 与人类相比如何?Human Comparison:在相近时间和计算预算下,表现怎么样?

  • 换个任务还有效吗?Held-out Transfer:离开优化时使用的任务、模型或领域,收益是否仍然成立?

这四类证据不能相互替代。一套系统可以在某个测试上提高,却没有证明它能够保留收益或迁移到新任务。研究没有报告某项结果,也不能直接理解为已经测试失败。

为什么多做几轮不一定越来越好?因为系统可能忘记早期约束,逐渐偏离目标;也可能越来越善于迎合评分方式,却没有解决真实问题。某个版本一度表现最好,后续修改也可能把收益丢掉。


图4|错误会在不同阶段累积:一次尝试中的操作失误、多次尝试间的状态丢失,以及后续版本的退化。结果是否可信、收益来自哪里,也需要贯穿全程的检查。

因此,要支持更强的 recursive self-improvement 主张,需要跟踪后续版本,在明确且可比较的条件下持续验证,确认改进被保留,并确实帮助下一代继续进步。

未来可以用在哪里

从综述覆盖的方向看,AI4AI的应用空间包括机器学习工程、训练流程优化、计算效率优化,以及研究工作的复现与验证。它们都包含反复提出方案、执行、检查和修复的过程。

对研究团队而言,一个有价值的方向是让AI接手目标清楚、结果可检验的研发环节,同时保留可追溯的实验记录。这样既能利用自动化,也便于判断哪些工作可靠、哪些仍需人类参与。

对智能体开发团队而言,综述提供了一套定位问题的思路:是模型不会做,信息传递出了错,评价机制不可信,还是有效的改进没有被保留下来?不同原因,需要不同的解决办法。

更远的前景,是让系统不仅完成一次改进,还能把经过验证的经验和收益交给下一代。但按照这篇综述梳理的证据,可靠的研究判断、持久且可迁移的收益,以及跨代累积的改进,仍有待更充分的验证。

CanAIimprove AI?

现有研究给出了有边界的肯定:AI能在明确条件下帮助改进AI。

下一步的挑战,是让每一次可信的改进,都成为下一次进步的起点。

参考资料:

https://www.preprints.org/manuscript/202608.2108

编辑:LRST

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
看了《什么意思夫妇》,说实话,这电影跟网上说的不一样!

看了《什么意思夫妇》,说实话,这电影跟网上说的不一样!

向东的自留地
2026-10-02 12:14:54
善恶有报,移居英国仅2年,57岁吴秀波再迎噩耗,步入李易峰后尘

善恶有报,移居英国仅2年,57岁吴秀波再迎噩耗,步入李易峰后尘

有范又有料
2025-12-17 14:54:06
2-0,25岁中国金花首夺亚运会网球女单冠军,37岁张帅获得银牌

2-0,25岁中国金花首夺亚运会网球女单冠军,37岁张帅获得银牌

侧身凌空斩
2026-10-02 14:47:05
糖尿病一点面条不能吃?医生劝告:不想糖尿病恶化,这些东西少吃

糖尿病一点面条不能吃?医生劝告:不想糖尿病恶化,这些东西少吃

医学科普汇
2026-10-02 22:00:08
文旅创新工委会为什么不敢直面阿丘过往言论

文旅创新工委会为什么不敢直面阿丘过往言论

小眼睛小世界
2026-10-03 07:27:44
李小冉反问“你们还有戏拍”?直接把赵今麦问懵了

李小冉反问“你们还有戏拍”?直接把赵今麦问懵了

韩小娱
2026-10-02 17:02:32
我命由我不由“泰”!苏超淘汰赛,泰州太想赢,南通不答应

我命由我不由“泰”!苏超淘汰赛,泰州太想赢,南通不答应

林子说事
2026-10-02 14:15:35
随着法国1-1意大利、比利时3-0、波兰6-0、积分榜彻底乱了

随着法国1-1意大利、比利时3-0、波兰6-0、积分榜彻底乱了

纵横之策
2026-10-03 06:42:42
4岁男孩被拐8年,在商场门口听到口琴声突然愣住:曲子是我妈吹的

4岁男孩被拐8年,在商场门口听到口琴声突然愣住:曲子是我妈吹的

温情邮局
2025-09-12 10:18:12
轻奢酒店卧室,吊带短裙配花饰高跟,出场直接惊艳全场

轻奢酒店卧室,吊带短裙配花饰高跟,出场直接惊艳全场

云端小院
2026-09-04 08:20:59
阿联酋总统顾问称迪拜航空驾驶舱冲突系“恐袭”

阿联酋总统顾问称迪拜航空驾驶舱冲突系“恐袭”

新京报
2026-10-02 19:38:21
为什么无底线善意反而会招来杀身之祸

为什么无底线善意反而会招来杀身之祸

风铃草语
2026-10-03 07:14:12
中金保荐!首日暴涨266%隔日暴跌48%,物理AI大牛股成割韭菜利器,股民:报警

中金保荐!首日暴涨266%隔日暴跌48%,物理AI大牛股成割韭菜利器,股民:报警

金石随笔
2026-10-03 07:15:55
田曦薇的《嫁金钗》接档《兰香如故》,考验《逐玉》后的扛剧能力

田曦薇的《嫁金钗》接档《兰香如故》,考验《逐玉》后的扛剧能力

楚楚号
2026-10-03 07:18:00
普京带货中国汽车:买吧,又便宜又好,很快所有人都得开中国车

普京带货中国汽车:买吧,又便宜又好,很快所有人都得开中国车

极目新闻
2026-10-02 12:00:21
贾乃亮前妻过生日,海参配高档红酒,杜华于正也在,女儿甜馨未见

贾乃亮前妻过生日,海参配高档红酒,杜华于正也在,女儿甜馨未见

洲洲影视娱评
2026-10-02 17:43:18
义和团圣母林黑儿:被洋人折磨到死,尸体带回欧洲,制成标本展览

义和团圣母林黑儿:被洋人折磨到死,尸体带回欧洲,制成标本展览

风飘飘而吹衣
2024-12-22 17:16:56
上海财大气粗,为了拿下拉塞尔,交调节费

上海财大气粗,为了拿下拉塞尔,交调节费

体育篮球弟
2026-10-03 05:36:11
名校光环有那么重要?河南考生675分,不去上交大选北大护理,本人回应:不觉得护理比工科低一等

名校光环有那么重要?河南考生675分,不去上交大选北大护理,本人回应:不觉得护理比工科低一等

王大嘴评说
2026-10-02 08:42:51
中方连番问责,日本外相恼羞成怒,终于说出心里话:谁也不许再提

中方连番问责,日本外相恼羞成怒,终于说出心里话:谁也不许再提

不似少年游
2026-10-02 07:08:54
2026-10-03 08:11:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16330文章数 67111关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

男子错订机票3分钟内申请退款被扣90%手续费 多方回应

头条要闻

男子错订机票3分钟内申请退款被扣90%手续费 多方回应

体育要闻

30天30队·快船:被莱纳德挂在半空的未来?

娱乐要闻

潘玮柏老婆被猜怀二胎 中秋vlog露馅

财经要闻

珠宝黑马爆雷,老板全家跑路泰国!

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

数码
房产
时尚
公开课
军事航空

数码要闻

英伟达推出64GB版DGX Spark:售价4999美元 128GB版本价格已突破6000美元

房产要闻

三亚楼市炸了!首个空中泳池平层+CBD独一份洋房同时爆出!

伊姐十一热推:电视剧《无可替代》;电视剧《雷霆令》......

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

胡塞武装:24小时内沙特空袭也门47次

无障碍浏览 进入关怀版