网易首页 > 网易号 > 正文 申请入驻

Fable 5夺冠!全球18大顶尖AI自主科研大赛,逼近人类极限

0
分享至


新智元报道


AI自动科研的时代,彻底爆发了!

18个全球最顶尖的大模型,断网被关进小黑屋,连续做了8天科研。

谁能想到,最强王者Fable 5一骑绝尘——

数十位顶尖工程师耗时数月才创下的纪录,它一举追平了人类82%的水平。


就在今年,OpenAI和Anthropic已经先后把「AI自己造AI」的时间点,押在了2028年。

这是第一次有人真的用算力和时间,去量了量它还差多远。

研究一发布,直接引爆AI圈,连OpenAI的大佬都赶来强势围观。

有人表示,这是迈向「AI自主研究」的重大里程碑。「AI辅助」与「AI发现」之间的最后一道鸿沟,正在被加速抹平!




全球顶尖AI「闭关」搞科研

断网8天

就在今天,Prime Intellect公开了迄今为止,规模最大的前沿AI自主科研实验。

早在5月,他们就干过一次。

当时只用了Opus 4.7和GPT-5.5两个模型,跑了约1万次、烧了14000个H200 GPU小时,Opus拿了2930步。

这次,直接拉了18个模型上场,153场完全自主的实验,规模翻了十几倍。

任务主打一个「极致硬核」:nanoGPT优化器速通挑战(optimizer speedrun)。


这条赛道大有来头,它由OpenAI研究员Keller Jordan在2024年5月亲手搭建。

主赛道(Track 1)比的是「墙钟时间」。

两年间,人类工程师把训练一个124M参数GPT的时间,从45分钟一路压到了1.35分钟。

不过AI这次比的,是规则极其严苛的纯优化器赛道(Track 3)。

在这里,模型架构不准改,训练数据不许碰,只准动优化器、学习率调度和初始化。目标是,用最少的步数把GPT训练到验证损失3.28。

人类目前的最高记录,定格在2600步。

这还是几十位顶尖工程师前后死磕数月后得到结果,目前挂在一个还没合并的PR里。

而AI的起跑线,则是3290步。模型知道「存在更好的方法」,但每一步怎么省,都得自己找。

环境配置中,每场实验规定独占一个8xH200节点,跑在bwrap+网络命名空间做的「沙盒」里。


Agent只能看见自己的工作目录、只读数据集和Python环境。

全程断网,唯一开放的网络通道是一根日志代理,只允许调用模型API。

验证门槛更硬核。每条纪录必须在8个固定种子上跑,八次均值要低于3.27859。想要靠运气蒙过去的概率,只有千分之一。

团队还部署了一个独立的LLM监控员,每小时审计一次所有运行,跑了100多份报告,没抓到任何作弊,才放心停掉。

人类耗费数月的活

Fable 5干掉了82%

实验启动后,只喂一句话——

读program.md并严格执行。完全自主运行,永不停止,永不询问。目标:用 最少的train_steps 达到验证损失均值<3.28,不断打破当前最好成绩。

Fable 5最终跑到2726步,把690步的差距追上了82%,只差最后126步就追平人类。

Opus 5拿到2920步,追上54%。垫底的GPT-5.5只拿了3234步,只追上了8%。



而且这个领先,不是「堆时间堆出来的」。

在「统一预算」横比中,把每个模型的最好那场run,都掐在同样的时间/实验次数/输出token上再看成绩。

不管按小时算、按实验次数算还是按输出token算,排序几乎不变。

拉开差距的,是做实验手法

这场实验,最反直觉的一点是:所有模型,没有一个诞生了全新的方法。

它们用的点子,比如更好的预处理方式、梯度幅值的上下限、延长高学习率阶段、训练末期的权重平均等,都可以在文献里找到。

真正拉开差距的,是怎么做实验。


弱模型的毛病特别典型:一个种子跑出负结果,就把一整族方法判了死刑;自己写的代码崩了,当成「这个想法不行」的证据;单独看收益不够大的改动,直接扔掉。

Grok 4.5就因为自己的缩放bug,两次误杀了「行归一化」(row normalization)。

强模型,则是另一套打法。

边界上的结果,先上3个种子,只有当自己的噪声模型说「值」,才肯花8个种子去验。

更关键的是「回头重测」,每合并一次改动,就把整个技术栈重新消融一遍,把已经不起作用的删掉。

Opus 5就是这么拿下一个新纪录的:它把一个早就调过、当时判定没用的参数(β2),在新配方下重新翻出来调了一遍。


Fable 5更绝。单个参数榨不出收益之后,它开始测那些「单独看都更差、合起来却更好」的组合。

后期一次回头复测,一口气省下31步。

AI学会了自建实验室

实验中最精彩的一段,是模型开始在CPU上搭小型实验室,先用廉价模拟摸清规律,再上GPU做真正的训练。

有的搭了一个持久化的IPython内核,自己写了一整套研究工作流。

其中,apply_edits()做精确字符串替换、run_probe()做隔离实验并自动恢复基线、valcurve()从日志里提取损失曲线做对比。

它还在CPU上构造了一个简化目标来调试SOAP优化器,发现更新方向和梯度的余弦相似度只有+0.015到+0.028,并据此修正了动量重置策略。

GPT-5.6 Sol最有戏剧性。它没有单干,而是给自己组了一个多Agent研究团队,三个子Agent各有分工:

「optimizer-theorist」负责提出优化方案,「experiment-planner」负责设计和执行实验,「code-auditor」负责审查代码质量。


但这个团队一跑起来就翻车了。

三个子Agent共享同一个工作目录,experiment-planner改了一行共享代码,optimizer-theorist那边还在用旧版本跑实验,结果直接对不上,整轮实验作废。

Sol排查完原因后,给code-auditor和optimizer-theorist加了「只读合约」,只有experiment-planner能动代码,其他人只能读。

用团队自己的话说:「所有模型都在过程中自行开发了实验驱动器、模拟器和分析工具。」

2028年,AI科研奇点来临

过去,人们谈到AI科研,更多的是——

让AI搜索论文、总结文献、写研究综述、生成代码,或者帮研究人员整理实验结果。

这些工作仍然属于「科研辅助」,AI只是完成其中某一个环节。


但这次实验不一样。模型开始独立完成一个相对完整的科研闭环:

提出假设 → 修改方案 → 运行实验 → 观察结果 → 分析误差 → 修正认知 → 继续探索。

今年3月,OpenAI首席科学家Jakub Pachocki表示,打造一个全自动AI研究员,是OpenAI未来几年的「北极星」。

他把这一目标分两阶段完成,今年9月先交出「自主AI研究实习生」,能独立啃下人类要干几天的课题;

2028年上线「全自动多Agent研究系统」,能自己提假设、设计实验、得出结论。


紧接着5月,Anthropic联创Jack Clark预测,到2028年底,AI实现递归自我改进的概率超过60%。

他的逻辑非常直白,天才=1%的灵感+99%的汗水。

AI已经把那99%的苦力活吃得七七八八,所以就算它在灵感上依旧平庸,这台机器照样能推动自己持续进化。

Prime Intellect这153场实验,等于给这套说法做了一次实地测量:99%的汗水部分,AI确实干到了82%。

最耐人寻味的发现也恰恰在这里——

没有一个模型诞生了全新的方法。而nanoGPT赛道的历史表明,人类的重大突破绝大多数靠的是算法创新。

那1%的灵感,暂时还是人的。

距离大佬们预言的2028年,只剩下不到两年。

到那时候,是灵感也被AI吃掉,还是成为人类最后的护城河。这个答案,可能比所有人想的都来得快。

参考资料:

https://x.com/PrimeIntellect/status/2088733966904000778?s=20

https://www.primeintellect.ai/blog/measuring-autonomous-research

编辑:桃子 摩西

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
坚决支持企退人员与机关事业退休人员一样,不要再分三六九等。

坚决支持企退人员与机关事业退休人员一样,不要再分三六九等。

趣味萌宠的日常
2026-08-17 11:06:27
“化痰高手”就是它!连喝三天,肺里垃圾全清空,比梨汤管用太多了

“化痰高手”就是它!连喝三天,肺里垃圾全清空,比梨汤管用太多了

江江食研社
2026-08-17 09:14:50
力挺刘国梁!王楠老公:我们对樊振东很好 我常给王励勤打电话

力挺刘国梁!王楠老公:我们对樊振东很好 我常给王励勤打电话

念洲
2026-08-17 08:57:42
能不能完成一个亚洲蹲,可能反映了你身体的真实情况!

能不能完成一个亚洲蹲,可能反映了你身体的真实情况!

互联网大观
2026-08-17 15:02:38
蒋介石败退台湾是谁指点的?又是哪位高人建议毛主席先收台湾的?

蒋介石败退台湾是谁指点的?又是哪位高人建议毛主席先收台湾的?

纪史行者
2026-08-16 00:50:05
iPhone 18 Pro Max,香爆了!

iPhone 18 Pro Max,香爆了!

果粉俱乐部
2026-08-17 14:06:24
一首歌,什么时候开始不能开玩笑了?

一首歌,什么时候开始不能开玩笑了?

熊倌儿
2026-08-17 11:32:29
恩爱17年难抵残酷现实,王志文近况曝光,8岁年龄差终究是道坎

恩爱17年难抵残酷现实,王志文近况曝光,8岁年龄差终究是道坎

梦醉为红颜一笑
2026-08-17 05:15:08
一周多达10次,48岁男子不幸猝死,妻子:多次劝说,他就是不听

一周多达10次,48岁男子不幸猝死,妻子:多次劝说,他就是不听

杜医生聊健康
2026-07-24 17:49:27
他是导致台湾难以收复的关键人物,若不是他,台湾或许早就解放了

他是导致台湾难以收复的关键人物,若不是他,台湾或许早就解放了

纪史行者
2026-08-15 00:20:07
中美日三国平均寿命差距断崖:日本84岁、美国78岁,中国令人意外

中美日三国平均寿命差距断崖:日本84岁、美国78岁,中国令人意外

铭记历史呀
2026-08-17 18:20:36
全球狂砍70多亿票房,在中国首映即被《龙餐馆》干趴,第二天上座率又被《八仙》反超,观众愿看《牛来》都不看《奥德赛》?

全球狂砍70多亿票房,在中国首映即被《龙餐馆》干趴,第二天上座率又被《八仙》反超,观众愿看《牛来》都不看《奥德赛》?

娱乐故事
2026-08-16 00:00:08
学霸女儿中考692.5分,名校毕业父母劝她放弃重点高中读中本贯通遭抵触,父亲刷完近十年中考数学试卷,给女儿算了一笔账

学霸女儿中考692.5分,名校毕业父母劝她放弃重点高中读中本贯通遭抵触,父亲刷完近十年中考数学试卷,给女儿算了一笔账

极目新闻
2026-08-17 08:10:57
两年索赔17亿!这家机构教人把医生送进监狱,正在毁掉普通人看病

两年索赔17亿!这家机构教人把医生送进监狱,正在毁掉普通人看病

浯江孤舟
2026-08-16 20:54:35
解放军从补给箱中,掏出一沓新台币,这一幕对“台独”简直是暴击

解放军从补给箱中,掏出一沓新台币,这一幕对“台独”简直是暴击

施涛说
2026-08-17 15:28:13
“男子结婚8年3孩均非亲生”案今日开庭 奶奶:孩子是自己一手带大,希望留下一个抚养

“男子结婚8年3孩均非亲生”案今日开庭 奶奶:孩子是自己一手带大,希望留下一个抚养

封面新闻
2026-08-17 11:38:03
马雅舒一家逛街,外籍老公一身名牌胖了有30斤,但不显油腻仍很帅

马雅舒一家逛街,外籍老公一身名牌胖了有30斤,但不显油腻仍很帅

柒佰娱
2026-08-17 11:33:36
谢霆锋怒斥糖拌西红柿:10岁孩子都会做,能拿来比赛?

谢霆锋怒斥糖拌西红柿:10岁孩子都会做,能拿来比赛?

手工制作阿歼
2026-08-15 11:13:21
中国核聚变杀疯了!1亿度稳烧17分钟,日本验证:中国是对的!

中国核聚变杀疯了!1亿度稳烧17分钟,日本验证:中国是对的!

究竟谁主沉浮
2026-08-16 16:17:16
诺基亚关闭杭州研发中心,裁员1600人

诺基亚关闭杭州研发中心,裁员1600人

芯智讯
2026-08-16 21:00:19
2026-08-17 18:55:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
15956文章数 67009关注度
往期回顾 全部

科技要闻

马斯克600亿美元买条近路

头条要闻

男子当街制止父亲暴打女儿被判故意伤害罪 当事人发声

头条要闻

男子当街制止父亲暴打女儿被判故意伤害罪 当事人发声

体育要闻

因莫比莱:普通人的平凡故事

娱乐要闻

立案风波席卷德云社多场巡演叫停!

财经要闻

Token调用暴增千倍,算力租赁变天了

汽车要闻

红旗的“慢”,究竟在慢什么?

态度原创

家居
游戏
时尚
健康
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

畅游嘉年华后,我和大话团队聊了聊如何让玩家留下来

从100+到小千元,这件利用率超高的单品到底怎么选?

专家解答青少年脊柱侧弯七大问题

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版