网易首页 > 网易号 > 正文 申请入驻

AI自己造AI,概率60%,2028年底前!Anthropic联创坐不住了

0
分享至


新智元报道

编辑:元宇

【新智元导读】Anthropic联合创始人Jack Clark读完数百份公开数据,得出一个让他自己也坐不住的结论:2028年底前,AI自己造AI的概率是60%。支撑他这一判断的,是编程、科研复现、模型训练优化等多条能力曲线:每一条都在向右上方飞,没有减速迹象。

AI系统,可能很快就能自行构建自身了!

说这句话的人,是Anthropic联合创始人Jack Clark。

5月4日,他在X上发帖:「我认为,递归自我改进(RSI)有60%的概率在2028年底之前发生。」


除了Anthropic联合创始人身份之外,Clark还是《Import AI》的创办者兼主笔,长期跟踪AI能力进展。

这次发帖,他在《Import AI》上同时发布了一篇完整的分析文章。


https://importai.substack.com/p/import-ai-455-automating-ai-research

这是一件大事。我不知道该如何理解它。这是一个我不情愿接受的看法:其影响太过巨大,让我感到自身渺小,而且我不确定,社会是否已准备好迎接自动化AI研发所带来的变革。

Clark在文章里写:如果这一天到来,人类将跨过一道「卢比孔河」,进入一个几乎无法预测的未来

他不认为这会发生在2026年,但他预判一两年内可能在非前沿模型上,出现这样的概念验证:一个模型,端到端训练出自己的继任者。

支撑Clark结论的,主要来自公开信息:arXiv、bioRxiv、NBER上的论文,加上他对各大前沿实验室产品的持续观察,Clark以此拼凑出一幅关于AI进展的全景图。

在他看来,AI工程化生产的所有组件,今天已经基本齐了。剩下的问题是:模型什么时候能积累足够的创造力,开始像人类研究员一样推动前沿演进。

四年

从30秒到12小时

Clark的核心论据,是一批能力进展曲线。

先看METR的时间轴图。


https://metr.org/time-horizons/

METR是一个专注AI能力评估的机构,他们追踪的是:AI系统能独立完成一项任务,在50%成功率水平线上,这项任务如果让一个熟练的人来做大概需要多少时间。

  • 2022年,GPT-3.5的数字是:30秒;

  • 2023年,GPT-4把这个数字推到了4分钟;

  • 2024年,o1推到了40分钟;

  • 2025年,GPT-5.2(高配版)跨到了6小时;

  • 2026年,Claude Opus 4.6已经到了12小时。

四年,从30秒到12小时,翻了1440倍!

AI能力研究员Ajeya Cotra认为,2026年底之前,这个数字有望突破100小时。

如果达到100小时时间跨度,它将能覆盖许多多日级软件/研究辅助任务。

编程能力同样也在起飞。

SWE-Bench衡量的是AI解决真实GitHub工程问题的能力。2023年底,Claude 2的得分是2%。到今年,Claude Mythos Preview达到93.9%,这个基准基本被打穿了。

CORE-Bench测的是另一件事:给AI一篇论文和对应的代码库,让它独立复现实验结果,这是AI研究员最基本的日常工作之一。

2024年9月该测试推出时,最好成绩是21.5%。2025年12月,Opus 4.5在Claude Code scaffold下verified accuracy 为77.78%,经人工校验后为95.5%,项目方称CORE-Bench已被解决。


https://hal.cs.princeton.edu/corebench_hard

15个月,从21.5%到95.5%。

MLE-Bench测的是AI独立参加Kaggle竞赛的能力,覆盖75个真实比赛项目。

2024年10月发布时最高分16.9%,到2026年2月,Gemini 3加搜索工具的组合已经达到64.4%。


https://github.com/openai/mle-bench

Anthropic内部还有一个测试:让模型优化一个仅使用CPU的小型语言模型训练代码,越快越好,以未优化版本的速度为基准。

  • 2025年5月,Claude Opus 4:2.9倍;

  • 2025年11月,Opus 4.5:16.5倍;

  • 2026年2月,Opus 4.6:30倍;

  • 2026年4月,Claude Mythos Preview:52倍。

不到一年,从2.9倍涨到52倍。

这是AI在优化AI训练代码这件事情上的进展速度。

99%的工程活

AI快接完了

这里有一个关键问题:AI研究这件事,到底有多少是纯工程,多少是真正的创意?

Clark给出了一个框架,引用了爱迪生那句话:天才是1%的灵感和99%的汗水。

他认为,AI研究也是如此。

一个典型的AI研究循环是这样的:拿一个现有系统,在某个维度上扩大规模,观察什么地方开始出问题,修掉工程问题,再扩大一轮。

这个过程里,大部分工作是数据清洗、跑实验、调参数、读论文、复现结果,这些都是「汗水」,不是「灵感」。

偶尔会出现真正改变范式的发明,比如Transformer架构,比如混合专家模型(MoE)。但那是1%,而且这1%越来越不是瓶颈,因为那99%的工程工作正在被AI快速接管。

Clark列了几个信号:

AI已经能管理其他AI。Claude Code、OpenCode这类工具里,单个AI可以扮演「项目经理」,把任务分发给多个子AI并行处理,之后汇总结果。

这和一个人类研究团队的组织方式没有本质区别。

PostTrainBench测试了一件事:AI能不能自己微调开源小模型,提升它在某个任务上的表现?

这个工作通常是前沿实验室里有经验的研究员在做。

截至2026年3月,AI系统在这个任务上能做到人类研究员效果的一半左右,大约是25%到28%的提升幅度,而人类基线是51%。


https://posttrainbench.com/

Anthropic内部还有一个「自动化对齐研究」的概念验证:让一组AI agent,在AI安全研究问题上自主攻关。

结果是,AI给出的方案超过了Anthropic人类研究员的基线。


https://www.anthropic.com/research/automated-alignment-researchers

Clark把这些证据串在一起的判断是:AI今天已经能自动化AI工程的绝大部分,AI研究里有多少能自动化,还不完全清楚,但迹象已经很明显。

质疑声也来了

Clark的帖子发出后,行业里也出现了一些质疑。

华盛顿大学机器学习教授,《终极算法》作者Pedro Domingos回复到:「从LISP在50年代发明以来,AI就能构建自己了。问题在于,这个过程究竟能带来递增回报还是递减回报——而目前没有任何证据支持前者。」


递归自我改进听起来很科幻,但能循环不等于循环有收益。如果每一代AI优化自己的效率只有边际改善,而不是指数级放大,那这件事的影响范围会非常有限。

还有人质疑概念边界。「RSI到底有没有一个权威定义?」一位名叫Dan Brickley的研究员问道。


另一个更尖锐的观察来自账号@crepesupreme:

2027年30%,2028年60%。一年内概率跳升30个百分点,意味着2027到2028年之间存在某个不连续的能力事件。那个具体事件是什么?

Clark在通讯文章里回应了这个隐含问题:他认为AI研究仍需要某种创意突破才能真正进入「自我研发」循环:AI目前在这一块还没有变革性的表现。这正是他给2027年只打30%的原因;而如果这个缺口在2028年底前被填上,概率就升到60%。

但他同时也承认,自己预判的是概率,而不是确切的时间点。

还有人问他:「你在Anthropic工作,你为什么要去翻公开数据?直接走下楼去问研究员不就行了?」

Clark的答案是:用公开数据,是因为公开数据才有可信度。他要的不是内部判断,是一个任何人都能独立核验的结论。

窗口还开着

但在缩窄

Clark在通讯文章里写:他为什么不给2027年更高的概率?

因为他认为AI研究还包含一些对创意直觉的要求,而AI目前在这一块只有「诱人的早期信号」,还没有系统性突破。

他列了两个信号:一个是Gemini模型参与攻克Erdős数学问题,在700个问题里解出了1个被数学家认为有一定原创性的解。

另一个是斯坦福、UBC等机构与Google DeepMind合作,AI在发现新数学证明中起到了「非常实质性的作用」。

这些结果在AI能力演化的时间轴上,可能是某种早期信号。

Clark的估计是:如果2028年底没有出现他描述的情况,那说明当前技术路径存在某个根本性的能力天花板,需要人类的创意才能突破。

更关键的是「如果出现了」之后的问题。

Anthropic在2026年3月宣布成立The Anthropic Institute时,官方声明里写了这样一句话:

如果AI系统的递归自我改进确实开始发生,那么世界上谁应该被告知,以及这些系统应该如何治理?


https://www.anthropic.com/news/the-anthropic-institute

连Anthropic自己,都还没有这个问题的完整答案。

Clark在通讯文章里给出了一个更技术性的担忧:今天的对齐技术,如果有99.9%的准确率,在递归迭代50代之后,准确率会跌到95.1%;迭代500代之后,跌到60.5%。

除非你的对齐方案在理论上能保证在更智能的系统上同样有效,否则问题会很快出现。

也许,Clark想要说的是:治理窗口是有限的,而且它正在缩窄。他希望通过文章发出一个提醒:这件事留给讨论、研究和治理设计的时间,比大多数人想象的短。

据奥特曼直播及媒体报道,OpenAI的目标是让AI在2026年9月前达到「AI 研究实习生」水平,2028年达到更完整的自动化研究员;Anthropic自己也在发表自动化对齐研究的概念验证;一家叫Recursive Superintelligence的新公司刚刚完成5亿美元融资,其目标之一就是自动化AI研究。

整个行业已经在朝这个方向加速了。

Clark说,无论从哪个维度看,数据都指向同一个方向,而每一条曲线,都在向右上方飞,时间越长,能力越强,而且没有任何一条显示出减速的迹象。

参考资料:

https://x.com/chatgpt21/status/2051314386317295758

https://importai.substack.com/p/import-ai-455-automating-ai-research

https://www.anthropic.com/research/automated-alignment-researchers

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
李嫣面相变了!素颜五官精致不显兔唇,和窦靖童同框抢眼超像王菲

李嫣面相变了!素颜五官精致不显兔唇,和窦靖童同框抢眼超像王菲

史之韵
2026-08-18 11:23:25
54岁古巨基庆生一家四口首同框!6岁长子清秀随妈,8个月大幼子大眼萌随爸

54岁古巨基庆生一家四口首同框!6岁长子清秀随妈,8个月大幼子大眼萌随爸

陈意小可爱
2026-08-20 13:40:47
5年1.25亿!自杀式合同!又一冠军球队解体

5年1.25亿!自杀式合同!又一冠军球队解体

篮球实战宝典
2026-08-20 20:27:14
软色情,渗入热门景区

软色情,渗入热门景区

视觉志
2026-08-17 09:59:22
极目调查丨两天两起伤亡事故背后的致命打卡:礁石拍照沦为危险的“游戏”,有摄影师称“浪越猛越好拍”

极目调查丨两天两起伤亡事故背后的致命打卡:礁石拍照沦为危险的“游戏”,有摄影师称“浪越猛越好拍”

极目新闻
2026-08-20 19:53:20
罗大佑前妻宣布支持民进党苏巧慧

罗大佑前妻宣布支持民进党苏巧慧

金牛传声
2026-08-20 12:10:59
四川升学宴5人死亡事件引爆热搜,真正的凶手其实是这个

四川升学宴5人死亡事件引爆热搜,真正的凶手其实是这个

脆皮先生
2026-08-20 21:06:18
58岁那英出镜被赞“身材管理好牛”:一三五练普拉提,二四六撸铁健身,喜欢跑步,能跑7公里;称演唱会全程全开麦、无修音,拒绝对口型

58岁那英出镜被赞“身材管理好牛”:一三五练普拉提,二四六撸铁健身,喜欢跑步,能跑7公里;称演唱会全程全开麦、无修音,拒绝对口型

极目新闻
2026-08-20 15:33:38
惊爆!劲爆!据称:“如果打击的有效性得到确认,几乎所有俄罗斯联邦的航天项目将被暂停”

惊爆!劲爆!据称:“如果打击的有效性得到确认,几乎所有俄罗斯联邦的航天项目将被暂停”

扶苏聊历史
2026-08-17 16:02:20
太恶毒!华人租客设局陷害房东:先冒名放弃绿卡,再冒名投票举报,害其被列入遣返程序

太恶毒!华人租客设局陷害房东:先冒名放弃绿卡,再冒名投票举报,害其被列入遣返程序

大洛杉矶LA
2026-08-20 05:52:21
网友称“升学宴致5死主家被警方带走”,相关部门回应:后续可能有通报;当地居民:摆酒很常见,主家不办反而显得不合群

网友称“升学宴致5死主家被警方带走”,相关部门回应:后续可能有通报;当地居民:摆酒很常见,主家不办反而显得不合群

极目新闻
2026-08-20 17:09:12
今夏第5援!巴萨官宣32岁葡萄牙飞翼第3次加盟,零转会费+签约3年

今夏第5援!巴萨官宣32岁葡萄牙飞翼第3次加盟,零转会费+签约3年

我爱英超
2026-08-20 21:21:11
浏览黄色网站到底违不违法?网警拆解3种情形,这些红线别碰

浏览黄色网站到底违不违法?网警拆解3种情形,这些红线别碰

小鹿姐姐情感说
2026-08-21 00:24:15
网传,浙江一省局副局长涉嫌酒后冲进卫生间性侵女干部!

网传,浙江一省局副局长涉嫌酒后冲进卫生间性侵女干部!

兵叔评说
2026-08-20 12:55:17
别克新车官宣:8月19日,正式上市

别克新车官宣:8月19日,正式上市

科技堡垒
2026-08-19 11:59:19
郭德纲麻烦大了!继西安演出被临时取消后,山东烟台的两场演出被通知延期并退票

郭德纲麻烦大了!继西安演出被临时取消后,山东烟台的两场演出被通知延期并退票

Mr王的饭后茶
2026-08-21 00:12:15
骑士交易达成!哈登年薪出炉,换汤不换药,克城争冠难度巨大

骑士交易达成!哈登年薪出炉,换汤不换药,克城争冠难度巨大

呆哥聊球
2026-08-20 10:56:45
万亿资产归零,全国第四大保险集团破产,1.5万亿保单怎么样了?

万亿资产归零,全国第四大保险集团破产,1.5万亿保单怎么样了?

米果说识
2026-08-17 19:17:49
全国夏季游泳锦标赛:潘展乐半小时1金1银,覃海洋100蛙夺冠

全国夏季游泳锦标赛:潘展乐半小时1金1银,覃海洋100蛙夺冠

全景体育V
2026-08-20 21:13:17
贝克汉姆家丑曝光:布鲁克林疑“娶了母亲”,因三百万断绝关系

贝克汉姆家丑曝光:布鲁克林疑“娶了母亲”,因三百万断绝关系

手工制作阿歼
2026-08-18 00:51:06
2026-08-21 07:03:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
15983文章数 67011关注度
往期回顾 全部

科技要闻

快手Q2研发狂烧45亿:如何面对双面夹击

头条要闻

10岁男童两次校外徘徊后溺亡 监控显示多次遭老师殴打

头条要闻

10岁男童两次校外徘徊后溺亡 监控显示多次遭老师殴打

体育要闻

46岁小罗抵达意大利 将为拉文纳征战意丙

娱乐要闻

任重晒全家福官宣二胎喜讯

财经要闻

许家印被判处无期 恒大集团被罚88.2亿

汽车要闻

比总部还大?比亚迪藏在上海虹桥的巨无霸闪充站!

态度原创

游戏
艺术
家居
公开课
军事航空

《绝地潜兵2》游戏总监访谈:我们有很多锤佬"/> 主站 商城 论坛 自运营 登录 注册 《绝地潜兵2》游戏总监访谈:我们有很多锤佬 D.哈卡...

艺术要闻

中国最强“造假大师”张大千:靠假画骗翻半个画坛,专家看完直接认输

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

弹药危机 美步入“战略更年期”的征兆

无障碍浏览 进入关怀版