网易首页 > 网易号 > 正文 申请入驻

Agent驱动的模型训练,基元律动做了一次迈向RSI的实验

0
分享至

编辑 | 泽南

Agent 完成任务后,学到的经验去了哪里?

一个 Agent 接到项目排期任务,它找到了工作目录里的文件,大致理解用户想要什么,却漏读了一封包含最新消息修改的邮件。随后,它沿着过时信息继续规划,生成了无效排期,最后还把文件写到了错误位置。

执行链在中途断掉,随后就全是基于错误推理的错误答案。看到之后,你显然会让 AI「重新审视问题」再生成一遍。问题在于,下一次怎么办?

今天的大多数系统中,Agent 的经验都留在日志里,模型每天在真实环境里产生的执行经验,几乎从不进入模型参数。这意味着模型下一次遇到相似任务,依旧可能踩一遍同样的坑。

基元律动最近发布的NeoHorse-1试图改变这件事。他们开源了 4B 与 9B 两个尺寸的模型,训练出来的思路听起来有点绕:让一个本来负责给模型「派活」的路由系统,顺便把所有模型走过的路记录下来,再把这些路教给一个小模型,让它自己就能走完一群模型走过的路。



  • 论文链接:https://arxiv.org/abs/2609.08183
  • HuggingFace:https://huggingface.co/collections/TokenRhythm/neohorse-1
  • GitHub:https://github.com/TokenRhythm/NeoHorse



这件事,被他们称为迈向 RSI 的第一次闭环验证

该模型由无问芯穹提供底层基础设施支撑与 Infra 优化技术能力,清华大学、北京大学团队参与算法和训练方法研究,共同探索提升 Agent 后训练的数据利用效率和训练效果。

大模型的终极目标:自我迭代

RSI(Recursive Self-Improvement,递归自我改进)是 2026 年 AI 领域一个炙手可热,也富有争议的词汇。它的愿景并不复杂:让 AI 把自己的产出作为经验重新喂回研发流程,参与设计更强的下一代自己,循环往复、自我升级。

今年 6 月,Anthropic 发布《When AI builds itself》,称在内部观察到了 RSI 的早期迹象。这个星期,OpenAI 发布博客首次公开了自己 RSI 的进展。OpenAI 称,其已经实现去年秋天定下的目标:在今年 9 月前造出一个「自动化研究实习生」。



但 Anthropic、OpenAI 自己也承认完整的 RSI 时代尚未到来,甚至不会必然发生。学术界今年涌现的一大批工作,从 Self-Harness、Continual Harness 到各类自我进化基准,大多还停留在「改进某个零件」的阶段。

人们争议的焦点很具体:AI 巨头口中的 RSI 目标很远大,实际操作起来却是个外界无法检查的黑箱。你既看不到训练数据如何流转,也复现不了那个闭环,最后只能选择相信或不相信。

在已经大规模应用的 AI Agent 上,工程层面的自我迭代也一直在进行中。对于 Harness 来说,决定表现的并不只在于底层模型。就像 DSH 之于 DeepSeek V4 Pro,一个设计得当的 Harness 才可以让模型发挥全部潜力。

当前,Agent 领域出现了两条并行演进路线。一条是在推理时更新外部系统,例如把成功经验写入 Memory、Skill 或 Harness;另一条则更进一步,让 Harness 框架直接参与模型训练。

NeoHorse-1 尝试用最简单的方式来实现训练的正循环,让我们看到了一个清晰可行的流程,它用的模型是 Qwen3.5 4B 和 9B,再把一个自我改进闭环拆成了四个可以逐环检查的零件,并全部开源。

要看懂它,得先从一个叫 OpenSquilla 的路由系统讲起。

Harness 框架,天然就是 AI 训练场

几个星期前,基元律动开源的 Harnes 框架 OpenSquilla 为这家公司基础设施层的创新开了个头。OpenSquilla 专注于通过高效率和低 Token 成本来运行和调度复杂的智能体任务,目标直指 Agent 落地的核心痛点。

一个复杂任务往往要跑数十轮,每一轮都调用最贵的旗舰模型,token 会顶不住。OpenSquilla 的做法是在 Harness 框架上装一个「路由器」,每执行一步之前先判断这一步需要多强的能力,再分派给够用且最便宜的那个模型或模型组合。按 benchmark 测试结果,这套机制可以省下 60% 到 80% 的 token 开支。

到这里,主要还是在想办法省钱。NeoHorse 的进一步洞察在于,路由器在派活的每一步都留下了三样东西:它预判了这一步需要什么能力、记录实际派遣的模型,还要观察这一步最终执行得怎么样。

换句话说,人与 AI 聊天的记录主要包含「问题 — 答案」,Routing Harness 产生的则是「需求预测 — 路由决策 — 执行过程 — 环境结果」。

这恰好就是一份完整的教学档案,基元律动决定拿它办学。NeoHorse 基于 Harness 训练 AI 模型的思路大致分为四步。



第一步是尽量保留 Agent 的「推理 — 行动 — 反馈」链条。Agent 的真实能力藏在交错的推理、工具调用、环境复现、报错后的恢复动作和最终交付产品之间。NeoHorse 把每一次完整交互保存为一条轨迹,再按用户轮次切成训练单元,当前轮的推理与动作是模型要学习的目标,更早的历史作为可以查阅的上下文。主语料库包含十万到百万条脱敏任务轨迹,另加公开数据补齐覆盖面。

第二步是判断轨迹能不能用。系统先用确定性规则检查工具调用是否有对应返回、事件顺序是否成立、是否缺少最终回复,以及执行分支能否闭合。结构完整的轨迹进入下一步;部分可恢复的记录只保留因果关系完整的片段;无法判断事件归属的轨迹则被隔离。

随后,系统从目标达成、指令遵循、工具使用、证据一致性、错误恢复和正确终止六个维度进行语义评估。NeoHorse 分别记录了通过、警告、失败或未评估几种状态,这样一来系统看到的不只是任务的执行情况,还能知道失败更可能发生在证据获取、工具选择还是终止判断上。

第三步,是用 Router 预测的能力需求进行课程学习。NeoHorse 直接借用 Routing Harness 的 C0 到 C3 分层作为难度信号:训练分三个阶段推进,先集中学低需求档任务,再逐步混入高需求档的硬任务,同时刻意把一部分简单样本留到最后阶段,防止模型到后期只会做难题。路由记录反映的是真实的用户覆盖、模型定价与可用性波动,比抽象的难度标签更贴近部署现场。

这里有一个容易被忽略的细节,系统并没有把「最终调用了哪个模型」直接当作难度标签。因为实际路由还可能受任务指定、服务可用性和系统策略影响。NeoHorse 使用的是回答发生之前,Router 根据请求及历史状态重新估计的能力需求。它决定样本什么时候出现,而不是简单告诉模型「这是一道难题」。

第四步,NeoHorse 还采用了路由引导的 On-Policy Distillation。传统蒸馏更像让学生模仿教师已经写好的标准答案;而在 On-Policy Distillation 中,学生先生成自己的响应,教师再沿着学生实际走到的位置提供下一步监督。通俗来说,它是让学生先做题,若走进岔路再进行纠正。

最后,模型评估结果会形成一张「能力短板地图」,反映哪些场景完成率低、哪种错误多发、哪个能力层级最薄弱。下一轮训练数据便向这些区域倾斜,同时维持基础能力覆盖。至此,评估、选择、更新,这一圈转起来,构成一次基元律动口中 RSI 闭环。

能力提升了多少?

NeoHorse-1 分别在 4B 和 9B 两个尺寸上进行了评测,覆盖 Harness Agent、工具调用、多轮交互、代码生成和指令遵循等十项 Benchmark。



自己跟自己比的话,4B 模型的平均分从 58.94 提高到 64.87,增加 5.93 分;9B 则从 65.60 提高到 69.04,增加 3.44 分。NeoHorse-1-4B 的综合结果已经接近 Qwen3.5-9B 基座的 65.60。报告还显示,在同一套路由课程配置下,Harness 轨迹训练出的检查点,在五个可比测试上的平均分比公开合成工具数据 Toucan 高出 6.26 分。

这些结果需要分开来看。NeoHorse-1-4B 达到同规模 SOTA 的提升,主要集中在 Harness Agent、工具交互和代码执行这类流程清晰、反馈可验证的任务上;但在需要长时间保持状态、反复测试修复、根据环境反馈改变策略的任务上,这个尺度依然吃力。参数规模没有失去意义 —— 后训练补上的是执行链条上的关键一环,而不是把能力边界整体抹平。

一项数据分析任务正好标出了这条边界。当环境中没有 pandas 时,NeoHorse-1-4B 没有及时识别出原方案已被环境阻断,而是反复尝试安装依赖、手动解析并修补脚本,最终没能生成报告。这类任务恰恰需要交给模型池中能力更强的模型 ——Agent 之间的差距有时不体现在「会不会做」,而体现在「路线对不对」;思考路线更准确的 Agent,往往反而消耗更少。

数字之外,Agent 在行为层面的变化更直观。票务日报任务里,基座模型处理工单状态前后矛盾后反复重写,二十多条记录越改越乱,NeoHorse 则会主动补取证据、识别更新后的约束、核对一致后再交付,最终 19 张工单匹配率达到 100%。五子棋网页任务里,同样的 26 次点击回放,基座模型全程报索引错误、棋盘始终空白,NeoHorse 则按顺序落下 13 黑 13 白、攻防轮转正常。



那么,这到底算不算是 RSI ?

这是不是真正的 RSI?

AI 的自我改进至少存在三个层次:模型在当前任务中发现错误并重试,是自我修正;系统把经验写入 Memory、Skill 或 Harness,是运行层适应;当经验进一步改变模型参数,更新后的模型又产生更好的新经验,并在多代循环中继续积累,才更接近完整的递归自我改进。

NeoHorse 已经具备其中几个关键特征:Harness 产生执行数据,评估发现能力缺口,数据配比随之调整,后训练更新模型,更新后的模型可以重新回到多模型池。团队将其概括为 Data-RSI 与 Model-RSI 这两个相连的环节。

但当前技术报告只验证了一轮「评估 — 选择 — 更新」。它还没有证明第二代、第三代模型能够持续获得增益,也没有让「如何改进模型」这套机制本身发生自动进化。随着模型变强,原先的数据可能失去价值;反复从自身轨迹学习,也可能放大偏差或造成能力退化。这些都需要跨代实验回答。

因此,正如基元律动所说的,NeoHorse 完成的是一次迈向 RSI 的、可复现的单轮闭环验证

虽然它不算证明 RSI 已经到来,但从现在起,RSI 已经可以被看作是一个可复现的工程问题。在基础大模型朝着参数、算力累加迭代的今天,这种新方向的优化尤其值得关注。

模型与 Harness 的飞轮,已开始旋转

在基元律动的愿景中,OpenSquilla 是模型执行与产生经验的场所,NeoHorse 则是经验进入模型参数之后的载体。

这套飞轮的理想状态是,OpenSquilla 用多模型完成任务并留下真实运行轨迹;NeoHorse 从中学习,逐步承担更多原本需要昂贵模型处理的工作;推理成本下降后,Agent 获得更多使用量;更多执行又产生新数据,推动下一轮训练。

以行业的角度来看,过去承载模型干活的 Harness 框架长期被视为缺乏技术含量,NeoHorse 给出的结论则是:谁能构建出一个持续运转、每一步都留下结构化记录的系统,谁就拿到了下一代 Agent 模型最便宜、也最难复制的训练数据。模型参数可以开源、可以追平,真实流量里踩出来的路不行。

NeoHorse-1 提出的模型成长路径,把 Harness 的重要性再次提升了一个台阶。现在,它越来越像连接用户任务、环境反馈和模型更新的中枢。

这还只是一次初步实验,未来的 Agent 系统,或许能让模型从每次执行的过程中持续成长了。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
阿联酋检方:迪拜航空涉事副驾驶使用消防斧实施“恐怖袭击”

阿联酋检方:迪拜航空涉事副驾驶使用消防斧实施“恐怖袭击”

新京报
2026-10-03 16:08:43
丰田新车官宣:10月3日开售,32.8万元

丰田新车官宣:10月3日开售,32.8万元

3C毒物
2026-10-03 15:52:55
"45秒,全没了!"柏林宣布退出申办,奥运会从顶级IP沦为财政噩梦

"45秒,全没了!"柏林宣布退出申办,奥运会从顶级IP沦为财政噩梦

云居历史
2026-09-28 15:40:23
两性关系:女人一旦过了50岁,对老伴的需求,居然是这3样

两性关系:女人一旦过了50岁,对老伴的需求,居然是这3样

风起见你
2026-10-03 19:35:17
斯瓦泰克:已从被郑钦文逆转中走了出来,中国球迷总让我感到惊喜

斯瓦泰克:已从被郑钦文逆转中走了出来,中国球迷总让我感到惊喜

懂球帝
2026-10-04 03:07:37
舅舅宴请全家族唯独漏掉我爸妈,我停掉母亲副卡,结账时舅舅愣住

舅舅宴请全家族唯独漏掉我爸妈,我停掉母亲副卡,结账时舅舅愣住

观观说事
2026-10-03 14:30:06
一个奇怪现象 : 为何网上失业哀鸿遍野 , 现实中大家都按部就班的工作

一个奇怪现象 : 为何网上失业哀鸿遍野 , 现实中大家都按部就班的工作

青史卷中人
2026-10-03 02:55:17
赵今麦海边泳装照冲上热搜,网友硬说像纸尿片,我看完直接笑出声

赵今麦海边泳装照冲上热搜,网友硬说像纸尿片,我看完直接笑出声

手工制作阿歼
2026-10-04 02:48:52
塞尔维亚高铁乘务员来华学习8天,惊叹中国高铁 顺带收获中国老公

塞尔维亚高铁乘务员来华学习8天,惊叹中国高铁 顺带收获中国老公

匹夫来搞笑
2026-10-03 01:19:21
空置率9.6%!深圳商场冰火两重天:一边冷冷清清,一边人挤到限流

空置率9.6%!深圳商场冰火两重天:一边冷冷清清,一边人挤到限流

说故事的阿袭
2026-10-03 14:04:13
俄军阵亡名单10天暴涨1万,这场战争已经换了一批人来打

俄军阵亡名单10天暴涨1万,这场战争已经换了一批人来打

史行途
2026-10-02 00:35:23
玥儿剪掉多年长发,饭桌上一举动太反常,看得人心里发酸

玥儿剪掉多年长发,饭桌上一举动太反常,看得人心里发酸

乡野小珥
2026-10-03 19:49:18
欧国联最新战报!7-0,3-1西班牙三连胜,英格兰造惨案,积分出炉

欧国联最新战报!7-0,3-1西班牙三连胜,英格兰造惨案,积分出炉

领悟看世界
2026-10-04 05:06:03
游客在堵车途中遇断网,发现前车尾部贴着“连我车载WiFi密码8个8”,车主:车辆有比较强的网络性能

游客在堵车途中遇断网,发现前车尾部贴着“连我车载WiFi密码8个8”,车主:车辆有比较强的网络性能

第一财经资讯
2026-10-03 08:18:18
莫言:永远不要期望一个没有血缘关系的人,能真正站在你的角度替你考虑问题——这是成年人最大的清醒

莫言:永远不要期望一个没有血缘关系的人,能真正站在你的角度替你考虑问题——这是成年人最大的清醒

杏花烟雨江南的碧园
2026-09-30 16:15:04
国庆跑600公里才彻底顿悟:电车省的是钱,油车、HEV省的是“命”

国庆跑600公里才彻底顿悟:电车省的是钱,油车、HEV省的是“命”

华庭讲美食
2026-10-02 14:04:30
河南延津一男子吸烟喝酒脑梗后哭着给媳妇道歉:对不起媳妇,我错了!应该早听话戒烟戒酒

河南延津一男子吸烟喝酒脑梗后哭着给媳妇道歉:对不起媳妇,我错了!应该早听话戒烟戒酒

潇湘晨报
2026-10-03 12:21:10
95年妻子去世后,丈母娘把妻姐许给我,新婚夜我才知道赚大了

95年妻子去世后,丈母娘把妻姐许给我,新婚夜我才知道赚大了

千秋文化
2026-06-11 18:00:17
猛然发现,现今没人提固态电池了?后路都让抄了,大饼画不下去了

猛然发现,现今没人提固态电池了?后路都让抄了,大饼画不下去了

一路荒凉如歌a
2026-09-29 16:03:49
15年前,新东方一老师用全部积蓄买下10万个比特币,现在过得咋样

15年前,新东方一老师用全部积蓄买下10万个比特币,现在过得咋样

云居历史
2026-10-04 04:44:16
2026-10-04 05:43:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14119文章数 142744关注度
往期回顾 全部

科技要闻

英伟达盘中创历史新高,市值逼近6万亿美元

头条要闻

刚刚拿到绿卡 中国籍夫妻突发车祸身亡

头条要闻

刚刚拿到绿卡 中国籍夫妻突发车祸身亡

体育要闻

这个讨论了一夏天的问题,马刺有答案了吗

娱乐要闻

马思纯一家爬山祈福!素颜出镜笑容甜

财经要闻

4亿台电视挂墙落灰 为何没人愿意开了?

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

本地
游戏
数码
房产
公开课

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

《巫师3》新MOD!狮鹫变鸽鸽 还会咕咕叫

数码要闻

开发者将iPhone 17 Pro Max变成MacBook Pro的第二块GPU

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版