网易首页 > 网易号 > 正文 申请入驻

闭源RSI的严父来了:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5

0
分享至

来源:量子位

henry 发自 凹非寺

量子位 | 公众号 QbitAI

刚刚,闭源RSI的钦点严父来了!

开源AI基础设施公司Prime Intellect在最新的一项研究中提出:

借助多智能体Harness,可以把监控和具体实现交给更小、更便宜的开源模型,,从而让“AI开发AI”变得更便宜,甚至效果更好。


在实验中,他们把Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3等18个前沿模型,扔进了一场nanoGPT优化器速通。

结果,开源权重模型Kimi K3搭配Prime Agent Harness后,在原始结果页中跑出了2930步的成绩。

这不仅超过了GPT-5.6 Sol的3042步,距离Claude的旗舰模型Opus 5的2920步也只差10步。


换句话说,在AI研究这件事上,一套由开源模型和Harness组成的系统,已经能够超过部分顶级闭源模型,甚至逼近第一梯队。

这一方面开始动摇过去那个最经典的RSI剧本:

某个最强闭源模型率先跨过“AI开发AI”的临界点,然后不断自我迭代,把其他玩家越甩越远,最终赢家通吃。

另一方面,Prime Intellect也展示了另一种可能:

模型不一定非得最强,只要底下这套科研机器足够高效,开源模型同样可以靠更高的试错吞吐量追上来。

而这,也进一步展示了Harness这类Agent编排框架,在AI4AI、AutoResearch上的潜力。

这是怎么做到的?

nanoGPT优化器速通

简单来说,这次Prime Intellect的实验,就是让十几个前沿大模型,去速通Karpathy那套著名的nanoGPT训练任务。


不过先澄清一点。

这次并不比谁能凭空发明一个多么原创的新算法。

Prime Intellect做的,是直接把AI扔进一个目标明确、反馈快速的真实训练任务里,看它能不能像人类研究员一样,不断提出假设、跑实验、看结果,再继续往下改。

Agent一开始会拿到一份带有baseline超参数的训练脚本,同时只得到一个提示:现在这套方案还不够好。

至于哪里能变好,怎么变好,没人告诉它:

究竟是换一种更好的预条件方法,给权重和更新幅度加上限和下限,调整学习率schedule,让高学习率保持得更久,还是在训练后期加入权重平均,都得靠Agent自己一点点试出来。

所以,这些实验到最后都只看一个指标:

用尽可能少的training steps,把一个1.24亿参数GPT的验证集loss降到3.28以下。

为了让大家从同一条起跑线出发,Prime Intellect把baseline定在了3290步。

作为参照,目前公开的最好纪录则是人类的2600步。

于是呢,整个比赛就变成了从3290步出发,看谁能把这个数字压得更低。

压得越低,说明它找到的训练recipe越高效,也就越接近顶尖人类研究者已经做到的水平。


具体的,参与测试的包括Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3、Grok 4.5、GLM 5.2、Muse Spark 1.1、DeepSeek V4 Pro、Grok 4.6、Muse Spark 1.2、Qwen 3.8等共计18个前沿模型。

每次启动之后,Agent会拿到三样东西:代码仓库、一份规则手册,以及一条目标指令。

实验统一运行在8张H200上,从这里开始,人类基本退出。

改优化器、写代码、启动训练、比较loss、判断结果是不是噪声、决定下一轮实验做什么,全都由Agent自己完成。

值得一提的是,为了防止它们直接上网抄现成答案,整个过程还被锁进sandbox,并且彻底断网。

实验验证

最终,Prime Intellect一共跑了153次全自主实验,单次最长持续超过8天。

然后,他们先得出了一个多少有点扫兴的结论:

没有任何一次实验,提出了真正意义上的全新方法。


最终有效的那些招数,无论是normalization、学习率调整、权重平均还是各种optimizer技巧,基本都能在已有研究里找到类似思路。

但也正因为大家最后找到的idea差不多,另一个现象反而变得更明显:

真正把模型拉开差距的,不是想到什么,而是怎么把它试出来。

这里咱们先放几个结论:

强模型不会轻易把一个idea判死刑。

弱模型常常一个seed跑差了就放弃,强模型会换seed、重新消融,甚至等recipe变了以后,再把旧方案捡回来重测。

Opus 5重新调β2后刷出了新纪录,Fable 5一次重新探测旧方案,又省下了31个steps。

强模型更会处理噪声。

它们会先判断一个小提升到底来自真实改进还是随机波动,再决定值不值得继续烧算力。

甚至有模型发现,同一个seed重复跑,loss也会因为GPU非确定性发生变化,随后直接围绕这个现象重做实验流程。

强模型还会自己造工具。

Kimi K3会自己写实验函数、比较loss曲线、恢复baseline,甚至搭一个小型数值实验室,先验证Newton-Schulz,再把结论带回真实训练。


而跑得最远的Fable 5,最终做到2726步。

从3290步baseline,到2600步的人类纪录,中间一共有690步优化空间。

Fable 5已经吃掉了564步,相当于走完其中大约82%。到这里,这次实验真正有意思的地方才出来。

因为如果十几个模型最后想到的东西都差不多,那么至少在这种研究任务里,idea本身可能没有大家想象中那么稀缺。

真正影响成绩的,反而是能不能多试几个方向,能不能更快排除错误,能不能抓住那些很弱但真实存在的信号,再把它们一轮轮叠起来。

换句话说,科研能力开始越来越像一个试错吞吐量问题。

而这,也正好解释了Prime Intellect为什么接下来把重点放到了Multi-Agent Harness上。

既然大量工作都落在写代码、跑实验、盯结果、做验证这些环节,那么就没必要每一步都调用最贵的前沿模型。

可以让更便宜的开源模型负责监控和实现,把真正需要判断的环节留给更强的模型。

这样一来,同样的钱能跑更多实验,同样的实验也能更快跑完。

而当一次试错越来越便宜,AI科研能力的提升,也就不一定非得等下一个更强的大模型。

把底下这套“试错机器”造得更好,本身就能继续把成绩往上推。

所以Prime Intellect下一步还准备把Speedrun扩展到训练栈的更多环节,同时继续放大实验规模。

从这个角度看,Multi-Agent Harness真正想加速的,也不只是nanoGPT。

它想加速的是AI研发本身的迭代速度。

这其实还真有点像OpenAI研究员翁家翌之前在Why Not TV里提到的一个判断:

对于人类研究员来说,idea本身往往很便宜。

大家能想到的方向,可能并没有想象中差那么多。

真正拉开差距的是 infra(基础设施)的迭代速度——谁能更快、更稳地验证想法、修 bug、跑实验,谁就能赢。


而放到AI4AI里,道理可能也一样。

我们未必需要每一步都让一个极其聪明、极其昂贵的模型亲自下场。

很多时候,真正需要解决的是:

怎么让一个还不错的模型,以足够低的成本,把实验循环跑得足够快。

这时候,便宜的开源模型+Harness,反而开始显出优势。

而且值得一提的是,在Kimi K3的测试中,正是Prime Intellect自家的Prime Agent Harness给模型提供了一个持久运行的 IPython 内核,让它们可以围绕研究任务,自己搭建和迭代一套工作流。

而这套内核也让K3得以在实验中,可以主动推翻自己的假设,从而提高效率。

这件事看起来只是一个小功能,但放到RSI里,其实很关键。


因为如果模型的能力短期内没有突然跳升,那么接下来最容易继续扩张的,可能恰恰就是模型外围的科研基础设施。

让它拥有更长时间的工作状态、更顺手的实验工具、更便宜的执行模型,以及能够同时跑更多假设的Multi-Agent系统。

最后得到的,不一定是一个突然“智力爆炸”的超级模型。

也可能是一台越来越便宜、越来越快、越来越不知疲倦的AI科研机器。


而如果AI开发AI最终真要进入指数级加速,Prime Intellect给出的这条路线至少提醒了一件事:

决定速度的,未必只有上面那个模型有多聪明。下面那套让它不断试错的机器,同样重要。

[1]https://www.primeintellect.ai/blog/measuring-autonomous-research

[2]https://www.primeintellect.ai/blog/prime-agent

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
歼-35总师曾一语道破:中国的两款六代机,可能再一次出人意料

歼-35总师曾一语道破:中国的两款六代机,可能再一次出人意料

史行途
2026-08-11 00:31:36
徐良是国家级战斗英雄还是叛徒逃兵,杀人犯,公理何在?

徐良是国家级战斗英雄还是叛徒逃兵,杀人犯,公理何在?

疯狂的小历史
2026-08-18 10:04:55
1969年,他推掉进入政治局常委的机会,邱会作不解:为什么呀?

1969年,他推掉进入政治局常委的机会,邱会作不解:为什么呀?

大运河时空
2026-08-18 08:10:03
西梅被发现!研究发现:吃的越多,肠息肉复发风险或有所降低?

西梅被发现!研究发现:吃的越多,肠息肉复发风险或有所降低?

宝哥精彩赛事
2026-08-16 06:00:08
6600元 国产激光灭蚊器Photon Matrix开始量产 首批设备本月发出

6600元 国产激光灭蚊器Photon Matrix开始量产 首批设备本月发出

快科技
2026-08-18 08:13:10
王楠的天塌了,她老公直播爆粗怒怼:我沾她屁光!全网炸锅

王楠的天塌了,她老公直播爆粗怒怼:我沾她屁光!全网炸锅

涵有话说
2026-08-07 09:40:25
2023年,100岁的基辛格预测:若爆发三战,敢打美国本土仅3个国家

2023年,100岁的基辛格预测:若爆发三战,敢打美国本土仅3个国家

李哥三观很正
2024-09-01 04:23:53
五百名医生已证实:维生素B12与甲钴胺的真相,最好花点时间看看

五百名医生已证实:维生素B12与甲钴胺的真相,最好花点时间看看

路医生健康科普
2026-08-03 15:25:14
2026年最失败的5所211大学,高分学生不敢报考,录取分数线暴跌!

2026年最失败的5所211大学,高分学生不敢报考,录取分数线暴跌!

本末倒置也
2026-08-17 07:18:25
外媒:乌兹别克斯坦采购24架歼-10CE,中国生产完成已经交付?

外媒:乌兹别克斯坦采购24架歼-10CE,中国生产完成已经交付?

影孖看世界
2026-08-17 21:35:22
美日国债抛售潮愈演愈烈,“危险”模式正在开启

美日国债抛售潮愈演愈烈,“危险”模式正在开启

贝壳财经
2026-08-18 20:30:04
女生办健康证性生活却被印在上面,内容太辣眼!医院态度让人气愤

女生办健康证性生活却被印在上面,内容太辣眼!医院态度让人气愤

番外行
2026-06-02 14:11:26
中方撤了,大幅抛售260亿美债,英国也抽身走人,最大冤大头浮现

中方撤了,大幅抛售260亿美债,英国也抽身走人,最大冤大头浮现

梦史
2026-08-19 00:02:50
追了9年才娶了妻,因妻子怕疼他做了12年丁克,余生只想宠着她

追了9年才娶了妻,因妻子怕疼他做了12年丁克,余生只想宠着她

旧史新谭
2026-08-19 03:29:34
前妻嫌他穷住地下室离婚,如今他靠《重器》翻红,还娶小十岁教授

前妻嫌他穷住地下室离婚,如今他靠《重器》翻红,还娶小十岁教授

暖心萌阿菇凉
2026-08-18 07:56:41
全国首单!广西一车主被罚!

全国首单!广西一车主被罚!

广西交警总队
2026-08-18 20:38:12
54年汤恩伯到日本看病,却没能返回,蒋介石冷漠道:死了也好!

54年汤恩伯到日本看病,却没能返回,蒋介石冷漠道:死了也好!

历史龙元阁
2026-08-17 06:45:27
哪个瞬间让你发现了世界的bug?网友:看下来,我开始怀疑人生了

哪个瞬间让你发现了世界的bug?网友:看下来,我开始怀疑人生了

苗苗情感说
2026-08-18 00:57:39
一度突破6.74,什么在支撑人民币汇率走强

一度突破6.74,什么在支撑人民币汇率走强

财经杂志
2026-08-18 15:53:17
45 分钟征服巴萨!7000 万神锋首秀封神!欧冠夺冠就靠他

45 分钟征服巴萨!7000 万神锋首秀封神!欧冠夺冠就靠他

澜归序
2026-08-18 10:07:07
2026-08-19 05:12:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4465799文章数 9319关注度
往期回顾 全部

科技要闻

英伟达的资本局:从AI卖铲人到AI央行

头条要闻

女子称住民宿被员工打开房门看光:我全裸在擦身体

头条要闻

女子称住民宿被员工打开房门看光:我全裸在擦身体

体育要闻

中国男篮,一直被质疑,永远被期待

娱乐要闻

蓝盈莹官宣新恋情

财经要闻

一场酒局献祭,掀开了杭州地产潜规则

汽车要闻

满配华为乾崑智能科技 奕境X9预售价29.98万-37.98万

态度原创

游戏
房产
教育
本地
公开课

《剑星》开发商新作规划曝光:3A大作与三上真司新作

房产要闻

又又又狂抢207轮!海口土拍,彻底爆了!

教育要闻

“就业率”最高的5所大学,不是清华北大,学生还没毕业就被签走

本地新闻

邂逅活珊瑚的西沙,感受独属于国人的浪漫

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版