网易首页 > 网易号 > 正文 申请入驻

Fable 5夺冠!全球18大顶尖AI自主科研大赛,逼近人类极限

0
分享至


新智元报道


AI自动科研的时代,彻底爆发了!

18个全球最顶尖的大模型,断网被关进小黑屋,连续做了8天科研。

谁能想到,最强王者Fable 5一骑绝尘——

数十位顶尖工程师耗时数月才创下的纪录,它一举追平了人类82%的水平。


就在今年,OpenAI和Anthropic已经先后把「AI自己造AI」的时间点,押在了2028年。

这是第一次有人真的用算力和时间,去量了量它还差多远。

研究一发布,直接引爆AI圈,连OpenAI的大佬都赶来强势围观。

有人表示,这是迈向「AI自主研究」的重大里程碑。「AI辅助」与「AI发现」之间的最后一道鸿沟,正在被加速抹平!




全球顶尖AI「闭关」搞科研

断网8天

就在今天,Prime Intellect公开了迄今为止,规模最大的前沿AI自主科研实验。

早在5月,他们就干过一次。

当时只用了Opus 4.7和GPT-5.5两个模型,跑了约1万次、烧了14000个H200 GPU小时,Opus拿了2930步。

这次,直接拉了18个模型上场,153场完全自主的实验,规模翻了十几倍。

任务主打一个「极致硬核」:nanoGPT优化器速通挑战(optimizer speedrun)。


这条赛道大有来头,它由OpenAI研究员Keller Jordan在2024年5月亲手搭建。

主赛道(Track 1)比的是「墙钟时间」。

两年间,人类工程师把训练一个124M参数GPT的时间,从45分钟一路压到了1.35分钟。

不过AI这次比的,是规则极其严苛的纯优化器赛道(Track 3)。

在这里,模型架构不准改,训练数据不许碰,只准动优化器、学习率调度和初始化。目标是,用最少的步数把GPT训练到验证损失3.28。

人类目前的最高记录,定格在2600步。

这还是几十位顶尖工程师前后死磕数月后得到结果,目前挂在一个还没合并的PR里。

而AI的起跑线,则是3290步。模型知道「存在更好的方法」,但每一步怎么省,都得自己找。

环境配置中,每场实验规定独占一个8xH200节点,跑在bwrap+网络命名空间做的「沙盒」里。


Agent只能看见自己的工作目录、只读数据集和Python环境。

全程断网,唯一开放的网络通道是一根日志代理,只允许调用模型API。

验证门槛更硬核。每条纪录必须在8个固定种子上跑,八次均值要低于3.27859。想要靠运气蒙过去的概率,只有千分之一。

团队还部署了一个独立的LLM监控员,每小时审计一次所有运行,跑了100多份报告,没抓到任何作弊,才放心停掉。

人类耗费数月的活

Fable 5干掉了82%

实验启动后,只喂一句话——

读program.md并严格执行。完全自主运行,永不停止,永不询问。目标:用 最少的train_steps 达到验证损失均值<3.28,不断打破当前最好成绩。

Fable 5最终跑到2726步,把690步的差距追上了82%,只差最后126步就追平人类。

Opus 5拿到2920步,追上54%。垫底的GPT-5.5只拿了3234步,只追上了8%。



而且这个领先,不是「堆时间堆出来的」。

在「统一预算」横比中,把每个模型的最好那场run,都掐在同样的时间/实验次数/输出token上再看成绩。

不管按小时算、按实验次数算还是按输出token算,排序几乎不变。

拉开差距的,是做实验手法

这场实验,最反直觉的一点是:所有模型,没有一个诞生了全新的方法。

它们用的点子,比如更好的预处理方式、梯度幅值的上下限、延长高学习率阶段、训练末期的权重平均等,都可以在文献里找到。

真正拉开差距的,是怎么做实验。


弱模型的毛病特别典型:一个种子跑出负结果,就把一整族方法判了死刑;自己写的代码崩了,当成「这个想法不行」的证据;单独看收益不够大的改动,直接扔掉。

Grok 4.5就因为自己的缩放bug,两次误杀了「行归一化」(row normalization)。

强模型,则是另一套打法。

边界上的结果,先上3个种子,只有当自己的噪声模型说「值」,才肯花8个种子去验。

更关键的是「回头重测」,每合并一次改动,就把整个技术栈重新消融一遍,把已经不起作用的删掉。

Opus 5就是这么拿下一个新纪录的:它把一个早就调过、当时判定没用的参数(β2),在新配方下重新翻出来调了一遍。


Fable 5更绝。单个参数榨不出收益之后,它开始测那些「单独看都更差、合起来却更好」的组合。

后期一次回头复测,一口气省下31步。

AI学会了自建实验室

实验中最精彩的一段,是模型开始在CPU上搭小型实验室,先用廉价模拟摸清规律,再上GPU做真正的训练。

有的搭了一个持久化的IPython内核,自己写了一整套研究工作流。

其中,apply_edits()做精确字符串替换、run_probe()做隔离实验并自动恢复基线、valcurve()从日志里提取损失曲线做对比。

它还在CPU上构造了一个简化目标来调试SOAP优化器,发现更新方向和梯度的余弦相似度只有+0.015到+0.028,并据此修正了动量重置策略。

GPT-5.6 Sol最有戏剧性。它没有单干,而是给自己组了一个多Agent研究团队,三个子Agent各有分工:

「optimizer-theorist」负责提出优化方案,「experiment-planner」负责设计和执行实验,「code-auditor」负责审查代码质量。


但这个团队一跑起来就翻车了。

三个子Agent共享同一个工作目录,experiment-planner改了一行共享代码,optimizer-theorist那边还在用旧版本跑实验,结果直接对不上,整轮实验作废。

Sol排查完原因后,给code-auditor和optimizer-theorist加了「只读合约」,只有experiment-planner能动代码,其他人只能读。

用团队自己的话说:「所有模型都在过程中自行开发了实验驱动器、模拟器和分析工具。」

2028年,AI科研奇点来临

过去,人们谈到AI科研,更多的是——

让AI搜索论文、总结文献、写研究综述、生成代码,或者帮研究人员整理实验结果。

这些工作仍然属于「科研辅助」,AI只是完成其中某一个环节。


但这次实验不一样。模型开始独立完成一个相对完整的科研闭环:

提出假设 → 修改方案 → 运行实验 → 观察结果 → 分析误差 → 修正认知 → 继续探索。

今年3月,OpenAI首席科学家Jakub Pachocki表示,打造一个全自动AI研究员,是OpenAI未来几年的「北极星」。

他把这一目标分两阶段完成,今年9月先交出「自主AI研究实习生」,能独立啃下人类要干几天的课题;

2028年上线「全自动多Agent研究系统」,能自己提假设、设计实验、得出结论。


紧接着5月,Anthropic联创Jack Clark预测,到2028年底,AI实现递归自我改进的概率超过60%。

他的逻辑非常直白,天才=1%的灵感+99%的汗水。

AI已经把那99%的苦力活吃得七七八八,所以就算它在灵感上依旧平庸,这台机器照样能推动自己持续进化。

Prime Intellect这153场实验,等于给这套说法做了一次实地测量:99%的汗水部分,AI确实干到了82%。

最耐人寻味的发现也恰恰在这里——

没有一个模型诞生了全新的方法。而nanoGPT赛道的历史表明,人类的重大突破绝大多数靠的是算法创新。

那1%的灵感,暂时还是人的。

距离大佬们预言的2028年,只剩下不到两年。

到那时候,是灵感也被AI吃掉,还是成为人类最后的护城河。这个答案,可能比所有人想的都来得快。

参考资料:

https://x.com/PrimeIntellect/status/2088733966904000778?s=20

https://www.primeintellect.ai/blog/measuring-autonomous-research

编辑:桃子 摩西

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
金鹰奖颁奖夜,胡歌没等结束就离场,这一走,走出一个时代的告别

金鹰奖颁奖夜,胡歌没等结束就离场,这一走,走出一个时代的告别

娱圈办事处
2026-10-01 15:38:05
刚刚!中央电视台国庆节晚会节目单正式发布

刚刚!中央电视台国庆节晚会节目单正式发布

草莓解说体育
2026-10-01 13:38:38
林志玲51岁登封被指认不出别再猜动脸了她只是不想再当志玲姐姐了

林志玲51岁登封被指认不出别再猜动脸了她只是不想再当志玲姐姐了

草莓解说体育
2026-10-02 02:40:06
4-0!2-0!中国香港队豪取两连胜,拿满6分锁定第一,PK柬埔寨争冠

4-0!2-0!中国香港队豪取两连胜,拿满6分锁定第一,PK柬埔寨争冠

绿茵舞着
2026-10-02 00:09:39
10月1日六大行存款利率更新?22万存三年,哪家利息更高?

10月1日六大行存款利率更新?22万存三年,哪家利息更高?

民市井财策
2026-10-01 17:00:28
葡萄牙4-2丹麦,霍伊伦破门+复刻C罗招牌庆祝动作,拉莫斯传射

葡萄牙4-2丹麦,霍伊伦破门+复刻C罗招牌庆祝动作,拉莫斯传射

懂球帝
2026-10-02 04:48:21
山东一211新生吐槽生活不便,离地铁站8.6公里,取快递走3公里,网友1秒猜出校名

山东一211新生吐槽生活不便,离地铁站8.6公里,取快递走3公里,网友1秒猜出校名

育学笔谈
2026-10-01 20:42:22
记录报:C罗离营当晚,葡萄牙队友直到睡前仍未得到足协解释

记录报:C罗离营当晚,葡萄牙队友直到睡前仍未得到足协解释

懂球帝
2026-10-01 22:55:04
请维护宪法尊严,查明人大代表多吉扎西被非法拘留、逮捕问题

请维护宪法尊严,查明人大代表多吉扎西被非法拘留、逮捕问题

老镡讲故事
2026-10-01 19:09:10
公路车骑行服,熟女骑行穿搭,利落面料勾勒饱满曲线

公路车骑行服,熟女骑行穿搭,利落面料勾勒饱满曲线

只要高兴就好
2026-09-24 11:58:50
舆论反转!Tiffany月饼风波引爆全网,涉事富婆组20个群上万人声讨,网友:人家丢了工作还不罢休,至于把销售往死里整吗

舆论反转!Tiffany月饼风波引爆全网,涉事富婆组20个群上万人声讨,网友:人家丢了工作还不罢休,至于把销售往死里整吗

火山詩话
2026-10-01 21:23:19
七天前C罗曾表示:如果教练不打算用我,我今天就可以离开

七天前C罗曾表示:如果教练不打算用我,我今天就可以离开

懂球帝
2026-10-01 08:54:09
太憋屈!5块金牌,5张非洲脸:谁在羞辱亚洲体育?

太憋屈!5块金牌,5张非洲脸:谁在羞辱亚洲体育?

荆楚寰宇文枢
2026-09-30 22:26:52
杭州降39%、广州降32%、上海降31%!不是房子卖光了, 是房东不卖

杭州降39%、广州降32%、上海降31%!不是房子卖光了, 是房东不卖

白米饭怎么吃
2026-09-30 12:59:30
10月开始迎来好消息,部分在职和退休人员有望陆续迎来工资上涨

10月开始迎来好消息,部分在职和退休人员有望陆续迎来工资上涨

虎哥闲聊
2026-10-01 08:41:56
林诗栋退出中国大满贯,退赛的三大诱因,王励勤和他交谈表情凝重

林诗栋退出中国大满贯,退赛的三大诱因,王励勤和他交谈表情凝重

乐悠悠娱乐
2026-10-01 09:14:54
瞒死者家属,遗体灌人造血模拟伤员,美国一大学竟长期向美军出售遗体用于训练以色列军人,被曝光2年后,项目终于被叫停

瞒死者家属,遗体灌人造血模拟伤员,美国一大学竟长期向美军出售遗体用于训练以色列军人,被曝光2年后,项目终于被叫停

每日经济新闻
2026-10-01 10:25:28
1987年,律师为一杀人犯申辩无果,没想到枪决执行4年后离奇反转:“死者”竟然活着回来了

1987年,律师为一杀人犯申辩无果,没想到枪决执行4年后离奇反转:“死者”竟然活着回来了

磊子讲史
2026-09-15 10:32:26
乌克兰外长发布重磅表态:乌方同意全面、立即且无条件停火

乌克兰外长发布重磅表态:乌方同意全面、立即且无条件停火

阿器谈史
2026-10-01 15:37:04
巴丹群岛38海里喊话没人理,菲律宾才发现:这次中国不是来抗议的

巴丹群岛38海里喊话没人理,菲律宾才发现:这次中国不是来抗议的

浯江孤舟
2026-09-30 10:04:37
2026-10-02 05:16:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16324文章数 67099关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

桂林市文促会深夜发布致歉信:向阿丘诚恳致歉

头条要闻

桂林市文促会深夜发布致歉信:向阿丘诚恳致歉

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

亲子
数码
教育
公开课
军事航空

亲子要闻

重新拥抱亲密:产后妈妈的温柔复兴之路

数码要闻

亚马逊发布全新Kindle:取消传统边框 正面屏幕实现全面平整化

教育要闻

QS排名贼靠后,却被低估的几所大学!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美防长宣布组建“自主作战司令部”

无障碍浏览 进入关怀版