网易首页 > 网易号 > 正文 申请入驻

RSI火了,但自进化也会过拟合:Google等提出RRSI,给自进化施加正则化

0
分享至



最近,Recursive Self-Improvement(RSI,递归式自我改进)正在迅速成为 Agent 领域最受关注的方向之一。

过去谈 RSI,我们很容易想到一个颇具未来感的场景:AI 修改自己的模型,再用更强的自己继续改进下一代系统。但真正落到今天的 Agent 上,RSI 已经有了一条更现实的路径 —— 不需要先修改模型权重,Agent 可以先修改 “模型外面的自己”。

Prompt 怎么写、什么时候调用工具、如何管理 Context 和 Memory、失败后怎么恢复、什么时候反思、什么时候停止…… 这些围绕模型构成的 Agent Harness,本身就决定了同一个基础模型最终能做成多少事情。

于是,一个很自然的闭环出现了:Agent 执行任务,观察失败,自动修改 Harness;修改后的 Agent 再执行任务,再根据新的反馈继续修改。这已经是一种真实发生在 Agent system level 的 Recursive Self-Improvement。

但问题也随之而来:如果一个 Agent 一轮又一轮地根据同一批任务修改自己,它到底是在 “进化”,还是只是在越来越会做这套题?



  • 论文链接:https://arxiv.org/abs/2609.24972
  • GitHub 链接:https://github.com/google-research/rrsi
  • 项目主页:https://regularized-rsi.com/

RSI 最大的隐患:越改越强,还是越刷越熟?

现有 Harness Evolution 通常遵循一个很直观的流程:先让当前 Agent 在一组任务上执行,根据成功和失败轨迹产生 feedback;然后让 LLM 修改 Harness,再把新的 Harness 放回同一批任务上评测。分数更高的版本留下来,进入下一轮。

问题是,这批 evolve tasks 会被一遍又一遍地使用。第 1 轮 Harness 的修改来自这些任务,第 2 轮又根据修改后的表现继续优化,第 10 轮、第 30 轮依然如此。整个过程逐渐变成了一个对有限数据持续进行的 adaptive search。

论文指出,这会带来三类耦合问题:benchmark-specific fitting、evaluation noise chasing,以及 complexity accumulation。Agent 可能记住当前 Benchmark 独有的 pattern,也可能把随机涨分误认为真实 improvement,甚至不断增加 Prompt、Context 和控制逻辑,用越来越多的 test-time compute 换取 evolve set 上的一点点提升。

最终就会出现一个非常反直觉的现象:evolve score 持续上涨,但真正离开 Evolution Set 后,收益却迅速缩水,甚至消失。



图 1|Evolve Set 上的提升,并不等价于 OOD 上的提升。

真正的问题不是 “Harness 能不能持续变高分”,而是这些改动离开反复见过的任务后,还剩下多少。

RRSI:不是限制 Agent 能改什么,而是 Regularize “它怎么改自己”

RRSI(Regularized Recursive Self-Improvement of Agent Harnesses)的关键设计,是没有把 Agent 的自我修改能力锁死。

Prompt 可以改,Control Flow 可以改,Tool 可以改,Memory、Skill、Context Management 可以改,甚至 Subagent 也可以增加或删除。换句话说,Agent 依然拥有一个开放的 self-modification space。

RRSI 真正 regularize 的,是 Agent 在这个空间中 “如何搜索”。它把 Harness RSI 拆成两个问题:Proposal 负责决定 “下一轮应该尝试改什么”,Selection 负责决定 “哪些修改真的有资格成为永久状态”。



图 2|RRSI 同时 Regularize Proposal 与 Selection,而不是限制 Harness 的可编辑空间。

在 Proposal 端,RRSI 首先限制一次 Self-Improvement 可以同时塞进多少相互纠缠的修改。前期允许更广泛的探索,但随着 Evolution 推进,每一轮允许同时修改的机制越来越少,让后期的每一次变化更容易归因。

同时,它会保留完整的 Evolution History:过去哪个 hypothesis 成功过、哪个机制已经失败过、某次修改增加了多少 score、付出了多少 cost,都会继续成为下一轮 Search 的 evidence。搜索长期停滞时,还会把部分 capacity 转向此前较少被探索的 Harness component。

Selection 端则更加严格:一个 Candidate 并不会因为 “分数涨了” 就自动成为下一代 Harness。Benchmark-specific 的改动会被提前筛掉;落在 evaluation noise 范围里的涨分不会轻易写入永久状态;额外增加的 Context 和 Token 必须用足够的 Performance Gain 证明价值;长期没有贡献的机制还会被直接 Prune。

换句话说,RRSI 不是阻止 Agent 变化,而是要求每一个想永久留下来的变化都 “证明自己”。

一个很反直觉的结果:Evolve Score 更高,反而进化得更差

这篇论文里最值得看的,并不是某个 Benchmark 又涨了几个点,而是下面这组 Ablation。

在 Agentic Workspace 上,如果去掉 Regularization,普通 Unregularized Evolution 可以把 evolve score 推到 92.8,高于 RRSI 的 90.5。如果仍然用传统的 “训练分数越高越好” 来判断,前者看起来显然更成功。

但到了三个完全不参与 Evolution 的 OOD Benchmark,结果反了过来:Unregularized Evolution 的 OOD Average 只有 40.3,而 RRSI 达到 43.6。与此同时,前者每个 Trial 需要 3.80M Policy Tokens,RRSI 只有 2.42M。

也就是说,更高的 Evolve Score 并没有带来更好的 Self-Improvement,反而对应更差的 Transfer 和更高的 Inference Cost。



图 3|去掉 Regularization 后,Evolve Score 更高,但 OOD 更差、Token 更多。图源:RRSI 论文 Table 2。

对于 RSI 来说,最大化 “眼前的 improvement”,本身就可能是一种 overfitting。

真正重要的是:离开 Evolution Set 之后,还剩下多少?

RRSI 最终在 Coding、Agentic Workspace 和 Engineering Design 三类环境、共 8 个 Benchmark 上进行了验证。

这里最重要的实验设置是:Harness 只在一个 Benchmark 上 Evolution,然后冻结,不再进行任何修改,直接放到整个 Self-Improvement 过程中从未见过的 Benchmark 上测试。

结果显示,Coding 中,从 Terminal-Bench 2.1 Evolution 出来的 Harness,在 SWE-bench Verified 上从 82.0 提升到 83.8;Agentic Workspace 中,JobBench 从 36.0 提升到 40.7,GDPval 从 48.8 提升到 52.3,APEX-Agents 从 34.2 提升到 37.9;Engineering Design 中,Frontier-Eng 从 17.7 提升到 22.0。

最高 OOD improvement 达到 + 4.7 points,并且 held-out splits 全部得到提升。



图 4|RRSI 在三个 Domain 上都把 Evolution 得到的改进迁移到了未见 Benchmark。

更好的泛化,不需要一个更 “重” 的 Harness

Harness Evolution 还有一个很现实的问题:Agent 完全可以通过不断加入更多 instructions、更多 context 和更多 recovery mechanism,让系统越来越复杂。分数可能因此上涨,但每一次 Inference 也会越来越昂贵。

因此,作者进一步比较了不同 Evolution 方法最终得到的 Harness Cost。结果很直观:RRSI 在 Agentic Workspace 上每个 Trial 大约消耗 2.42M Policy Tokens,而 Unregularized Evolution 达到 3.80M。与其他 Evolved Harness 相比,RRSI 也处在更好的 “更少 Token、更高 OOD” 区域。

这说明 RRSI 并不是靠给 Agent 塞进越来越多东西来获得 Transfer。相反,Regularization 会阻止没有足够收益支撑的复杂度增长,并删除已经不再贡献的机制。



图 5|横轴为 Policy Tokens / Trial,纵轴为 OOD Average。RRSI 同时获得更高 Transfer 和更低 Inference Cost。

30 轮进化曲线:真正留下来的改动只有 10 次

那么,一次 “被 Regularize 的自我进化” 到底长什么样?

下面这张图展示了 Gemini 3.5 Flash 在 Coding 任务 Terminal-Bench 2.1 上的 30 轮 Harness Evolution。最终,Incumbent Harness 从 64.6 提升到 78.7,一共增加 14.1 points。

但它并不是一路 “见到涨分就收”。30 轮 Evolution 里,真正被接受并成为新 Incumbent 的 Candidate 只有 10 个;还有 9 个 Candidate 没有产生足够的 measured gain,6 个在 Screening 阶段就被拒绝,2 个没有通过 Smoke Test,另外 3 轮没有产生 Proposal。

图中的浅蓝色区域是 noise-adjusted floor。也就是说,Candidate 的分数有一点点变化,并不能说明 Agent 真的进步了。一个修改只有提供了足够可信的 evidence,才有资格进入下一代 Harness。



图 6|Gemini 3.5 Flash 在 Terminal-Bench 2.1 上的 30 轮 RRSI Evolution Curve。蓝线为 Incumbent,浅蓝区域为 Noise-adjusted Floor。

Recursive Self-Improvement 的重点,不是让更多修改存活,而是让真正有用的修改存活。

RSI 走到下一步,问题已经不只是 “AI 能不能修改自己”

过去,人们讨论 Recursive Self-Improvement 时,最自然的问题是:AI 能不能修改自己?

但当 Harness RSI 真正开始跑起来之后,一个可能更困难的问题正在出现:AI 怎么知道,自己刚刚做出的修改究竟是真正的 Progress,还是一次 Benchmark-specific Optimization?一次分数上涨,是学到了更好的执行机制,还是碰巧利用了 Evaluation Noise?多加一段 Context,到底是在增强 Agent,还是单纯用更多 Test-time Compute 掩盖原来的问题?

如果 Self-Improvement 本身也是一个反复利用有限 Feedback 的 Adaptive Search Process,那么它自然也会遇到机器学习里非常熟悉的问题 ——Overfitting。

RRSI 想传递的核心观点其实非常简单:Self-Improvement 本身,也需要 Regularization。

下一阶段的 RSI,可能不只是追求 Self-Modification。更重要的是 Generalizable Self-Improvement:让 Agent 不只是越来越擅长 “改变自己”,而是逐渐学会判断,哪些改变是真正的进步,哪些改变只是在越来越会做自己见过的题。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
这就是赤裸裸的现实!工商银行已经到了最危险的时候?

这就是赤裸裸的现实!工商银行已经到了最危险的时候?

财经保探长
2026-08-23 21:43:55
WTT中国大满贯捷报:女单爆大冷!石洵瑶横扫,王曼昱迎恶战

WTT中国大满贯捷报:女单爆大冷!石洵瑶横扫,王曼昱迎恶战

兰亭墨未干
2026-10-08 03:58:38
没有鼠疫,没有封锁边境,俄罗斯不明原因肺炎事件,截至10月7日已确认信息

没有鼠疫,没有封锁边境,俄罗斯不明原因肺炎事件,截至10月7日已确认信息

晓看说
2026-10-08 00:05:28
不想进国家队了?热刺中场M费给C罗声明点赞

不想进国家队了?热刺中场M费给C罗声明点赞

懂球帝
2026-10-07 14:25:09
梅根急不可耐发新视频:莉莉半张脸抢镜,她忙着贴“企业家”标签

梅根急不可耐发新视频:莉莉半张脸抢镜,她忙着贴“企业家”标签

手工制作阿歼
2026-10-07 19:13:26
男子炮轰中国部分媒体!拿中国长处贬低他国短处,中国不是天堂,外国也不是地狱

男子炮轰中国部分媒体!拿中国长处贬低他国短处,中国不是天堂,外国也不是地狱

小徐讲八卦
2026-09-13 07:40:07
一觉醒来也门胡塞武装惨败,胡塞武装士兵还没来得及进入战壕,就被也门军队摩托化车辆追着碾压!

一觉醒来也门胡塞武装惨败,胡塞武装士兵还没来得及进入战壕,就被也门军队摩托化车辆追着碾压!

吃瓜小侦探
2026-10-06 21:54:11
猫妈知恩图报用4只崽送投喂人,奈何均遭拒。走到无人角落后:其实我也没有很想送你!抹泪ing

猫妈知恩图报用4只崽送投喂人,奈何均遭拒。走到无人角落后:其实我也没有很想送你!抹泪ing

猫来了
2026-10-06 17:08:28
中国再次让步:拒绝2400万美元赔偿后,送泰国S-26T潜艇超长质保

中国再次让步:拒绝2400万美元赔偿后,送泰国S-26T潜艇超长质保

铁锤侃侃而谈
2026-10-06 09:50:02
周恩来晚年坦言:若非毛主席拦下绝密军令,3万红军或全军覆灭?

周恩来晚年坦言:若非毛主席拦下绝密军令,3万红军或全军覆灭?

纪史行者
2026-10-03 03:50:06
没有司机的Waymo开上底特律街头,但你还打不到车

没有司机的Waymo开上底特律街头,但你还打不到车

闪存猎手
2026-10-07 02:13:14
汽车离加油站20多米时燃油耗尽,黄某请加油员手动灌油被拒,“不能卖散油”,无奈花350元叫拖车,加油站道歉

汽车离加油站20多米时燃油耗尽,黄某请加油员手动灌油被拒,“不能卖散油”,无奈花350元叫拖车,加油站道歉

农民日报
2026-10-07 18:56:43
A股:大家坐稳扶好了,不出意外,股市或将再次重演24年历史

A股:大家坐稳扶好了,不出意外,股市或将再次重演24年历史

财经大拿
2026-10-08 01:10:09
欧美如果真的联手卡死不给C919国际适航证,后果就是一句话:我们的国产大飞机技术再硬,也飞不出国门,根本进不了欧美市场

欧美如果真的联手卡死不给C919国际适航证,后果就是一句话:我们的国产大飞机技术再硬,也飞不出国门,根本进不了欧美市场

扶苏聊历史
2026-10-07 16:34:10
古代识人术:“马看四蹄,人看四相”,究竟是看哪四相?

古代识人术:“马看四蹄,人看四相”,究竟是看哪四相?

历史教堂
2026-09-04 14:44:02
网上把清朝说得一无是处为啥能统治268年看网友讲述内心一阵惊颤

网上把清朝说得一无是处为啥能统治268年看网友讲述内心一阵惊颤

侃神评故事
2026-08-17 18:12:00
帕拉南赛后采访引发争议,赢下孙颖莎不像是在比赛,而像是训练

帕拉南赛后采访引发争议,赢下孙颖莎不像是在比赛,而像是训练

南海浪花
2026-10-08 01:25:15
这3种手术千万别乱做!医生提醒:后遗症缠身时,后悔都晚了

这3种手术千万别乱做!医生提醒:后遗症缠身时,后悔都晚了

侯医生谈健康
2026-09-07 06:50:12
近10场有9场打满3盘!23岁郑钦文不愧是体能怪 短短44天排名暴涨79位

近10场有9场打满3盘!23岁郑钦文不愧是体能怪 短短44天排名暴涨79位

风过乡
2026-10-07 22:45:12
林毅夫:中国人均GDP达到美国一半时,美国就会心悦诚服中国崛起

林毅夫:中国人均GDP达到美国一半时,美国就会心悦诚服中国崛起

聚焦真实瞬间
2026-10-07 21:07:15
2026-10-08 05:36:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14143文章数 142744关注度
往期回顾 全部

科技要闻

诺贝尔化学奖揭晓,两位科学家摘得大奖

头条要闻

中国新婚夫妇在马尔代夫度假溺亡 有人1天目睹2起溺水

头条要闻

中国新婚夫妇在马尔代夫度假溺亡 有人1天目睹2起溺水

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

娱乐要闻

蔡康永风波再升级!这次谁也救不了他

财经要闻

谷歌签下科技史上最大核能协议

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

家居
本地
房产
数码
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

数码要闻

韩媒称三星12层HBM4E通过英伟达等客户验证 但尚无供货合同披露

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版