网易首页 > 网易号 > 正文 申请入驻

全球顶尖大模型一夜惨遭血洗!最难测试人类拿满分,AI第一名得0.2%分

0
分享至


新智元报道

编辑:Aeneas 好困

【新智元导读】今夜,整个AI圈震动了。全球最难AGI测试ARC-AGI-3一上线,就把全球顶尖AI打到集体失声,人类满分通关,最强模型Opus 4.6得分仅0.2%,还不到1%。AI这是一夜被打回「原始人」了。

就在今天,这条消息把整个AI圈给震了。

众望所归的,全球唯一尚未饱和的智能体基准测试ARC-AGI-3出炉了,直接血洗了全球顶尖大模型。

在这个测试中,人类得分100%,AI的得分普遍低于1%。


这个差距,比珠穆朗玛峰还高。

最惨烈的是,在上一代测试中还能拿下69.2%高分的「模范生」Opus 4.6,在ARC-AGI-3面前直接现了原形,得分仅为0.2%。


这位曾经横扫各大榜单的「学霸」,连蒙带猜都拿不到1分。

这面镜子,照出了当前AI能力中最深的裂缝。


在最近的采访中,老黄认为我们已经实现了AGI。但是ARC-AGI-3显示,或许如今的AI连1%的AGI都没有实现。


ARC-AGI-3,到底有多变态

它的前身ARC-AGI-1和ARC-AGI-2,已经是AI圈出了名的「魔鬼测试」。


那些测试里,AI需要观察几个示例,然后推断出网格变换的规律,完成新任务。

听起来不难?但就是这些看起来像幼儿园连线题的东西,曾经让无数大模型铩羽而归。

而到了ARC-AGI-3,难度直接换了个维度:从「静态题」变成了「互动游戏」。


150多个手工设计的交互式游戏环境,包含1000多个关卡。

每个游戏都有自己的内在逻辑、隐藏规则和通关条件。但没有任何说明文档,没有自然语言提示,没有人告诉你「左边的按钮会开门」或者「收集三个红色方块就能过关」。


AI智能体被丢进去,只能看到当前画面,选择一个动作,观察结果,再决定下一步。

它只能像盲人摸象一样,一步一步试探,然后在大脑里拼凑出一个「这个世界可能是这样运作的」的模型。


这正是ARC Prize基金会想测的四件事。

  • 探索:能不能通过主动与环境互动来获取关键信息?

  • 建模:能不能把零散的观察凝聚成一个可以预测未来状态的世界模型?

  • 目标获取:没有人下达指令,能不能自己判断出「我应该以什么为目标」?

  • 规划与执行:能不能规划出行动路径,并根据环境反馈随时修正?


「几何级数」的羞辱:0.2%是怎么来的?

评分标准同样残忍。

ARC-AGI-3的评分不看「有没有通关」,而是看「效率」,而且是和人类比效率。

这在AI基准测试的历史上,还是头一回。


受Chollet那篇《论智能的衡量》的启发,ARC Prize团队把「智能」操作化为一个转换率:

你从环境中获取信息的效率有多高?你把这些信息转化为正确行动的速度有多快?

假设人类解决这个游戏需要10步,而AI用了100步,那AI的得分是多少?

不是10%,而是1%。

公式是:(人类步数/AI步数)²。人类10步,AI 100步,那就是(10/100)²=0.01=1%。

如果AI用了200步,这一数字就是0.25%;500步就是0.04%。


这一下,把AI所有的「蛮力」路都堵死了。

以前AI可以靠穷举,把所有可能的操作试一遍,总能试出正确路径。

但在这种评分体系下,你多试一步,分数就断崖式下跌。

现在,你就知道了Opus 4.6得分只有0.2%的意味——

假设人类解决某个游戏用了10步,0.2%=0.002,开平方≈0.0447,10÷0.0447≈224步。

这已经不是「笨」了,这是在迷宫里原地转圈到天荒地老。

当这种差距被如此强烈地展示出来,很多以为AGI近在眼前的人,都震惊了。


350步 vs 两三下:成绩单全景

在正式发布之前,ARC-AGI-3跑了一轮为期30天的开发者预览。

三款公开游戏从地图导航到图案匹配再到水位调节,题目类型各异,但有一个共同点:人类觉得简单,AI觉得要命。



1200多名人类玩家参与了测试,完成了3900多场游戏。

大部分人不仅轻松过关,还玩得很开心,有些执着的玩家甚至一路「速通」挑战到了理论最优步数。

人类基线:100%。AI这边,前沿大模型得分全部低于1%。


预览期的冠军叫StochasticGoose,来自Tufa Labs。

它不是大模型,而是一个基于卷积神经网络的动作学习型智能体,用简单的强化学习来预测哪些操作会导致画面变化。最终得分12.58%,已经是所有参赛系统里最高的了。

但即便是这个冠军,在一款调水位的游戏里,开局也花了将近350步做无效的点击操作。

350步。人类大概只需要点两三下就能搞明白的事。

更反直觉的是,排行榜的前三名全是非LLM方案——CNN、基于规则的状态图探索、无需训练的帧图搜索。

一个基于CNN的方案,比GPT-5.x系列高出12个百分点以上。而那些接入了前沿大模型的智能体,成绩反而经常垫底,有的甚至频繁崩溃。


AI把自己坑了

ARC团队还发现一个特别有意思的现象。

AI的主要失败模式之一是:「以为自己在玩另一个游戏」。

比如,你被蒙上眼睛,扔进一个房间。

你摸到了一个圆形的物体,于是你断定:「这是个篮球场,我应该投篮。」但事实上,你拿的可能是一个西瓜,而房间其实是一个厨房。

AI犯的就是这样的错。

它在一个全新的环境里,看到一些初始的视觉信息,然后迅速给自己「脑补」了一个游戏框架,接着就沿着这个错误的假设疯狂执行计划,越走越偏,越偏越远。


它不会停下来想:等等,我怎么好像一直没得到正反馈?是不是我的假设错了?

因为当前的AI,缺乏一种「元认知」能力。也就是说,它不知道自己不知道。

这解释了为什么大模型反而垫底。

参数量越大、预训练知识越丰富的模型,越容易把陌生环境「脑补」成自己见过的东西,然后死磕到底。

而那些轻量级的CNN智能体和图搜索系统,反倒因为没有「先入为主」的包袱,能老老实实地从环境反馈中学习。


为什么人类能轻松通关?

ARC团队在文档里写了一句话:「人类不会蛮力行事。他们会构建思维模型,检验想法,并迅速改进。」

首先第一步,人类会构建思维模型。

一个人类玩家面对一个全新游戏时,第一件事不是「瞎点」,而是观察。几分钟之内,一个粗糙但可用的「世界模型」就建成了。

第二步,人类会检验想法。

如果结果和预期一致,模型得到强化。如果不一致,模型立即修正。

第三步,人类会迅速改进。错了就改,改了再试。

这种「探索-建模-验证-修正」的循环,在人类身上几乎是本能的。

而AI呢?只是一个「记住了很多答案」的应试高手,它的「学习」和人类的「学习」根本不是一个物种。

人类的学习是在线、交互、假设驱动的;AI的学习是离线、数据驱动、模式匹配的。

ARC-AGI-3没有任何「题海战术」可以覆盖,它考的是「怎么学习」。这恰恰是目前AI最弱的一环。


目前,这场挑战赛的奖金池高达85万美元,其中70万美元是给「满分通关者」的终极大奖。

参赛者必须完全开源代码,并且在无网环境下接受评估。这意味着你不能偷偷调用云端大模型,不能偷偷联网查资料。


和人类这个珠穆朗玛峰的差距,有AI能克服吗?

让我们静待结果。

参考资料:

https://x.com/Hesamation/status/2036861818321146306

https://arcprize.org/arc-agi/3

https://docs.arcprize.org/

https://x.com/fchollet/status/2036881543973790004

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
郭松民 | 评《欢迎来龙餐馆》:是的,“好好吃饭”!

郭松民 | 评《欢迎来龙餐馆》:是的,“好好吃饭”!

晴耕雨读社
2026-08-12 16:18:11
泰国公考曝出近年最大作弊丑闻:近6000人花钱买分,重新核查成绩后一女生逆袭,排名由全国第132升至第1;该作弊网络总涉案金额超9亿元

泰国公考曝出近年最大作弊丑闻:近6000人花钱买分,重新核查成绩后一女生逆袭,排名由全国第132升至第1;该作弊网络总涉案金额超9亿元

扬子晚报
2026-08-12 12:14:02
我瞒着省厅厅长的身份跟女友回家,饭桌上她当科长的爸突然站起来敬酒:李厅,后天省干部考察名单您看能定不?

我瞒着省厅厅长的身份跟女友回家,饭桌上她当科长的爸突然站起来敬酒:李厅,后天省干部考察名单您看能定不?

墨染尘香
2026-08-11 20:16:36
“车位泡沫”彻底破了?越来越多的地下停车位没人买了,原因有四

“车位泡沫”彻底破了?越来越多的地下停车位没人买了,原因有四

平说财经
2026-07-23 16:46:39
朱可夫晚年亲口承认:德军撤出莫斯科那一夜,并非俄军打赢了,是斯大林下了一道没人敢提的命令,如何在一夜之间捏碎了德军的铁血意志?

朱可夫晚年亲口承认:德军撤出莫斯科那一夜,并非俄军打赢了,是斯大林下了一道没人敢提的命令,如何在一夜之间捏碎了德军的铁血意志?

辛某人
2026-08-10 17:10:00
27岁以色列女演员:不在乎奥斯卡,只在乎10月7日女坦克兵的真实故事

27岁以色列女演员:不在乎奥斯卡,只在乎10月7日女坦克兵的真实故事

码上闲叙
2026-08-11 18:35:38
油车大势已去!7月乘用车销量榜出炉:前10仅剩1款燃油车

油车大势已去!7月乘用车销量榜出炉:前10仅剩1款燃油车

快科技
2026-08-11 15:36:30
赖清德副手险遭车祸,台当局要求大陆解释?大陆回8个字措辞严厉

赖清德副手险遭车祸,台当局要求大陆解释?大陆回8个字措辞严厉

疯狂的小历史
2026-08-12 10:52:59
程梦圆悲剧真相曝光:害死她的,根本不是内向

程梦圆悲剧真相曝光:害死她的,根本不是内向

据说说娱乐
2026-08-12 14:03:52
拍完新龙门客栈,梁家辉对张曼玉说:以后除了拍戏,咱俩别联系,这样对你我都好

拍完新龙门客栈,梁家辉对张曼玉说:以后除了拍戏,咱俩别联系,这样对你我都好

草莓解说体育
2026-08-10 16:30:35
湖南益阳博物馆被指宣传栏有多处错别字,“匕首”写成“七首”,“宗教”写成“宗救”,官方:已撤下,整改替换

湖南益阳博物馆被指宣传栏有多处错别字,“匕首”写成“七首”,“宗教”写成“宗救”,官方:已撤下,整改替换

大风新闻
2026-08-12 14:38:03
上海45岁女程序员被裁拿30多万,简历全沉了,现在送外卖,老妈哭了,哭的很伤心

上海45岁女程序员被裁拿30多万,简历全沉了,现在送外卖,老妈哭了,哭的很伤心

捣蛋窝
2026-08-11 22:49:34
朱女士“富太太人设”遭舆论质疑!网友:08年到19年10年时间,两人因二胎问题产生矛盾

朱女士“富太太人设”遭舆论质疑!网友:08年到19年10年时间,两人因二胎问题产生矛盾

火山詩话
2026-08-12 05:56:31
河南成强降雨中心 目前情况如何?记者现场直击

河南成强降雨中心 目前情况如何?记者现场直击

环球网资讯
2026-08-12 11:41:55
真是没想到!8月12日凌晨中国女篮传来3大主力,李梦、韩旭、张子宇最新消息!宫鲁鸣压力大

真是没想到!8月12日凌晨中国女篮传来3大主力,李梦、韩旭、张子宇最新消息!宫鲁鸣压力大

小七说篮球
2026-08-12 09:44:04
为什么红军到了陕北,就安全了?原因很现实,6个原因

为什么红军到了陕北,就安全了?原因很现实,6个原因

纪史行者
2026-08-10 21:21:43
无视中国网友!波兰名将拒道歉 继续辱华:中国气味像米饭配鸡肉

无视中国网友!波兰名将拒道歉 继续辱华:中国气味像米饭配鸡肉

念洲
2026-08-11 06:50:26
CCTV5直播,中国男篮VS黎巴嫩队,赛前传来2个喜讯,郭士强大考!

CCTV5直播,中国男篮VS黎巴嫩队,赛前传来2个喜讯,郭士强大考!

体坛小快灵
2026-08-12 08:34:47
大事不妙!支持率跌至35%,萨德导弹见底80%,特朗普的中东账本兜不住了!

大事不妙!支持率跌至35%,萨德导弹见底80%,特朗普的中东账本兜不住了!

News脑洞
2026-08-10 18:40:50
升空85秒突发解体!长征七号甲时隔六年再折戟

升空85秒突发解体!长征七号甲时隔六年再折戟

三体引力波
2026-08-11 01:47:35
2026-08-12 16:47:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
15923文章数 66999关注度
往期回顾 全部

科技要闻

Manus第二季,浪子回头

头条要闻

"不死富豪"患胃病治不好了:曾与17岁儿子换血以求长寿

头条要闻

"不死富豪"患胃病治不好了:曾与17岁儿子换血以求长寿

体育要闻

杜兰特,所谓的“联盟小王”

娱乐要闻

老戏骨杨昆两夺金鹰奖,因物业费被告

财经要闻

李嘉诚,再一次大撤退!他嗅到了什么?

汽车要闻

这台大众不一般 上汽大众ID.ERA.5S综合续航约2000公里

态度原创

艺术
家居
数码
亲子
公开课

艺术要闻

西班牙被低估的绘画流星|爱德华多・罗萨莱斯

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

颂拓推出SUUNTO CORE 2智能运动手表,1599元

亲子要闻

尽量不要怪自己!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版