网易首页 > 网易号 > 正文 申请入驻

门萨智商测试被AI考爆了!151满分登顶,99.97%人类被碾压

0
分享至

AI,直接把人类的智商测试干爆表了。

门萨挪威智商测试,35道难到离谱的图形推理题,限时25分钟。

Claude Fable 5.1,外加看图作答的GPT-6 Astra杀进考场,结果一道没错,直接轰出了这张卷子的理论极限151分。

而且是最近7次连考,次次满分。151只是卷子的天花板,它们自己的天花板在哪,还没人知道。


放到人类里,全世界近98%的人连130分的门萨入会线都摸不到,你我大概率都在被碾压的那一大拨人里。

不信邪的话,你先试试这张卷子里堪称地狱难度的第33题,答案放在第一节的末尾。


门萨挪威测试第33题

看懵了也别灰心。这题不光虐人,绝大多数AI也在这里栽了跟头。

这张卷子狠就狠在不考任何知识储备,它就甩给你一堆毫无头绪的破图形,看你能不能在一团乱麻里自己揪出规律。

心理学家管这种临场找规律的本事叫「流体智力」,它也是人类自诩聪明、用来碾压机器的最后一道防线。

结果现在,这道防线被AI轰得连渣都不剩了。

人类只测到145,AI考了151

点开TrackingAI的榜单,最先看到的是一条钟形曲线。

那是人类智商的分布,绝大多数人挤在100分附近的山包上。

过去,AI的头像还零零散散落在曲线左边的低分区。

现在,它们一个接一个挤到了曲线最右端那条孤零零的尾巴上,挤得头像都叠在了一起。旁边立着一根竖线,标注写着「本测试最高可能分(暂时)」。


TrackingAI上各家AI的门萨挪威成绩,最右侧竖线是这张卷的满分线

这张榜单是美国记者Maxim Lott攒出来的。

他像个苛刻的监考老师,每周给30多个主流AI做门萨挪威测试,有的模型听文字描述答题,有的直接看原图答题。成绩取最近7次的平均,所以想靠一次好运蒙上榜,门儿都没有。

他用的这套门萨挪威测试,本来是给人类准备的。人去做这张卷子,系统最高只报145分,再往上就不细分了。

而TrackingAI给AI打分,是按答对的题数继续往上换算,35道全对就是151,已经超出了门萨给人类设的量程。

不过,145封顶只是这张卷子的限制,人群里的智商并不封顶。

我们按智商的标准分布估算了一下,151分大约3000个人里才有1个。

放到全球80多亿人里,151分以上的人一共只有270万左右,一座千万人口的大城市里也就三千来个。

门萨俱乐部的入会线是130分,这两位满分AI已经高出整整21分。

而151还只是这张卷子的天花板,要是卷子能接着往上测,到了160分这一档,全世界只剩二十多万人。

AI站着的,已经是人类智商金字塔最顶上那一小撮人的位置。


而且能挤进这一小撮的,远不止这俩怪物。

在TrackingAI的榜单上,GPT-5.6 Sol和Gemini 3.1 Pro考到了145,公开卷上突破140分的模型已经排成一长串,国产模型也杀进了第一梯队。

这么多模型挤在高分段,差距就全拉在了最后几道压轴难题上。

TrackingAI统计过,前10题几乎是个AI就能拿分,到了卷子末尾,第35题只有5个AI做对,第33题更是只剩2个做了出来。

按Lott的换算,35道里错一道就只有148分,所以做对第33题的那2个,基本就是这两位满分选手。

开头那道题说好在这里公布答案,正确选项是E。


每道题做对的AI数量,橙色是门萨挪威卷,第33题只剩2个

满分本身已经够吓人,可要知道,就在几年前,AI还是个严重偏科的学生。

从64分到151分,AI只用两年半

2023年3月,芬兰一位心理评估专家给ChatGPT做了一套正规的韦氏成人智力测验,只考词汇、常识这些语言题。

ChatGPT直接考出155的语言智商,秒杀99.9%的人类。

可一遇到「塞巴斯蒂安孩子的父亲叫什么名字」这种拐个弯的脑筋急转弯,它就当场死机。

非语言部分更是没法测,用这位专家的话说,ChatGPT「没有眼睛、耳朵和手」。

看得出来,语言和知识一直是AI最拿手的那门课,图形推理才是它最大的软肋。

而门萨挪威卷考的,恰恰就是图形推理。

这种矩阵题最早是英国心理学家约翰·瑞文在1936年设计的,心理学家普遍把它看作最能测出一个人整体聪明程度的题型。

AI啃这块硬骨头,从1962年MIT第一个做几何类比题的程序算起,硬生生啃了60年。


我们根据公开资料整理的AI做智商题时间线

直到2024年初,Gemini Advanced做门萨卷上最简单的第1题,还能一本正经地编出一串「A+B=C」的方程,题里明明没有任何算式。


2024年2月,Gemini Advanced做门萨第1题,凭空编出一串方程

Lott把题一道道翻成文字念给AI听,结果也好不到哪去。有的AI只蒙对6道,考了个耻辱的64分,跟闭着眼睛在答题卡上乱涂差不多,最好的Claude-3也才刚刚越过人类平均线。

所以当时的Lott断言,AI还没有人类那种通用智能。没想到半年多以后,转折点就来了。

2024年9月,OpenAI的o1学会了三思而后行,开口之前先在内部推理,一步步试错、检查,分数一下冲过了120。

半年多前还说AI不行的Lott,这回写下的标题是「AI智能的巨大突破」。

从此,先想再答成了所有旗舰模型的标配,分数一路往上冲,今年4月,榜单上破天荒跳出了第一个151分。


我们根据TrackingAI和Maxim Lott公开的数据整理,每个点都是当时刷新的最高纪录

就这样,一个偏科了60年的学生,只用两年半,就从64分的瞎蒙选手考到了151分满分。

按Lott的统计,从2024年5月到2025年10月,头部AI的智商分数平均每个月狂涨2.5分。

相比之下,人类涨得有多慢,心理学里有现成的数据。

整个20世纪,随着营养和教育改善,人类的智商测验分数大约每十年才涨3分,这就是有名的弗林效应。

这么一比,人类要花30多年才爬完的10分,AI只要4个月就涨完了。

涨得这么快,任何正常人的第一反应都是,它是不是偷偷把答案背下来了?

换张没上过网的卷子,照样逼近满分

Lott当年也这么怀疑过。

毕竟门萨挪威测试在网上挂了很多年,题目和答案早被网友扒了个干净。

连TrackingAI自己都把35道题的文字版连同正确答案一起公开了,所以AI训练时大概率刷过。


TrackingAI公开的门萨挪威题文字版,右侧一栏就是正确答案

为了排除这种可能,2024年5月,他专门找了一位门萨会员从零出了一套新题。

这套题只找读者试做过一轮用来定分数标准,从没在互联网上露过面,任何AI的训练数据里都不可能有。

换卷之后,刷题效应确实露了出来。直到今天,有的模型一换到这张保密卷就原形毕露,比公开卷掉了二十来分。

可头部模型换了一张从没见过的卷子,照样逼近满分。

保密卷只有16道题,能打出的最高分大约是136,OpenAI的GPT-5.6 Terra看图版已经杀到135。

Fable 5.1和Astra也都有130分,旁边还并肩站着一个国产模型。


保密卷的成绩分布,这张卷从没上过网,竖线是它的满分线

去年10月,Lott还胸有成竹地立过flag,估计AI至少要再等两年,才能在这张卷子的看图版上拿满分,说好2027年万圣节回来验收。

结果不到一年,GPT-5.6 Terra就一脚油门冲到了线前,比他的预测早了一年多。

既然背答案解释不通,剩下的结论就只有一个,两年半前还在瞎蒙的AI,是真的长脑子了。

能难住AI的题,人类快出完了

卷子被考满了,出题的人只能接着换更难的。

所以TrackingAI在满分线旁边标的才是「最高可能分(暂时)」。

Lott去年底就盘算着,今年要给130分以上的区间补一批更难的题,好把高分段的AI重新拉开差距。

当然也有人不服。

「Keras之父」François Chollet设计了一套专门为难AI的推理测试ARC-AGI。

他前不久还放话,如果把智能定义成把经验转化为能力的效率,也就是见同样多的例子谁学得更快,现在的AI大约还落后人类6个数量级,差了一百万倍左右。

偏偏Chollet自己给AGI划的终点线,也落在出题上。

今年2月他透露,ARC-4正在憋大招,明年初发,后面还要出到第6、第7代。

用他自己的话说,关键是一直出新题,直到再也提不出人类能做、AI却做不到的题为止。

他当时给AGI估的时间是2030年前后。

这个月初有人再问他,2030年的判断还作不作数,他改口说会更早,因为进展比他预想的快。


有人问Chollet,2030年实现AGI的判断还算不算数

智商测试诞生于1905年。120年来,从学校分班到军队挑人,人类一直心安理得地用这把尺子给同类排座次。

这把尺子背后藏着一个人类几乎从没怀疑过的前提,被测量的只会是人,能站上最高刻度的也只能是人。

如今尺子还在,前提却已经塌了。一个压根不是人的东西,顺着刻度从头爬到了尾,最顶端的那根线也没能拦住它。

Lott还可以出更刁钻的卷子,Chollet也能接着掏出下一代ARC。

可照着AI两年半从瞎蒙到满分的速度,人类的大脑里还能榨出多少道AI解不出的题,已经没人敢打包票。

等到人类题库彻底枯竭的那一天,我们要重新思考的就不只是AI到底有多聪明,还有剥掉「聪明」这层外壳之后,人类自己究竟还剩下些什么。

参考资料:

https://x.com/aisafetymemes/status/2103369359481852116

文章来源:新智元。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
王希龙:徐州市委书记、市人大常委会主任

王希龙:徐州市委书记、市人大常委会主任

牛锅巴小钒
2026-09-29 04:05:35
每月163元养老金,这是一个民族对1.8亿老农民的亏欠

每月163元养老金,这是一个民族对1.8亿老农民的亏欠

涛哥锐评
2026-09-28 21:27:01
绝杀世界第一!肖嘉芮萱一日双金!

绝杀世界第一!肖嘉芮萱一日双金!

五星体育
2026-09-28 14:00:05
无侦-7亮相黄岩岛海空联演,优势何在?

无侦-7亮相黄岩岛海空联演,优势何在?

环球网资讯
2026-09-28 21:49:52
中国公民尽快撤离!外交部最高级别预警:这个地方比缅北还恐怖

中国公民尽快撤离!外交部最高级别预警:这个地方比缅北还恐怖

史之韵
2026-08-29 12:23:14
因“离婚一抱”引发热议,5年后她变得认不出了

因“离婚一抱”引发热议,5年后她变得认不出了

Yuki女人故事
2026-09-28 15:05:04
仁爱礁这扇门,关上了

仁爱礁这扇门,关上了

经点星娱
2026-09-27 21:29:22
不为二轮出局而来:詹姆斯亮相76人,一句话定调

不为二轮出局而来:詹姆斯亮相76人,一句话定调

林间小温柔
2026-09-29 05:36:43
华为新车官宣:9月28日  ,正式上市

华为新车官宣:9月28日 ,正式上市

科技堡垒
2026-09-28 10:20:27
发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

心理观察局
2026-08-01 07:10:30
加沙留学生自称参与10月7日袭击,荷兰大学将其停学

加沙留学生自称参与10月7日袭击,荷兰大学将其停学

桂系007
2026-09-28 13:37:06
南方小个子去北方究竟有多崩溃?网友:伤害性很大,侮辱性极强

南方小个子去北方究竟有多崩溃?网友:伤害性很大,侮辱性极强

另子维爱读史
2026-09-28 21:11:37
涨价涨到普通人不值得买的10样东西,大家听听是不是这么回事?

涨价涨到普通人不值得买的10样东西,大家听听是不是这么回事?

流苏晚晴
2026-09-21 13:07:44
齐达内罕见失态!奥利塞绝杀比利时后,他彻底绷不住了

齐达内罕见失态!奥利塞绝杀比利时后,他彻底绷不住了

元气满分吖
2026-09-29 05:40:16
东北离俄罗斯那么近,为什么东北男人很少娶毛妹当老婆?

东北离俄罗斯那么近,为什么东北男人很少娶毛妹当老婆?

未来力量
2026-09-28 13:14:43
“30年不评职称”!62岁985副教授,因病逝世

“30年不评职称”!62岁985副教授,因病逝世

双一流高校
2026-09-29 01:08:32
商河县委常委、副县长路来勇接受纪律审查和监察调查

商河县委常委、副县长路来勇接受纪律审查和监察调查

闪电新闻
2026-09-28 16:36:10
张本美和四大皆空!日本黄金组合0-2无缘冠军,恭喜王曼昱、蒯曼

张本美和四大皆空!日本黄金组合0-2无缘冠军,恭喜王曼昱、蒯曼

阿绐聊社会
2026-09-29 04:37:20
变天了?韩国瑜、卢秀燕、侯友宜或首次合体,蒋万安最大对手出现

变天了?韩国瑜、卢秀燕、侯友宜或首次合体,蒋万安最大对手出现

精彩一网打尽
2026-09-27 19:59:41
《兰香如故》林昭祥三次确认兰香!原来,这才是他愧对沈家的真相

《兰香如故》林昭祥三次确认兰香!原来,这才是他愧对沈家的真相

陈意小可爱
2026-09-28 13:32:40
2026-09-29 06:23:00
算法与数学之美 incentive-icons
算法与数学之美
分享知识,交流思想
5799文章数 64630关注度
往期回顾 全部

科技要闻

赛力斯华为合作模式生变后 余承东再次回应

头条要闻

王楚钦:现在打球环境像慢性毒药消耗自己

头条要闻

王楚钦:现在打球环境像慢性毒药消耗自己

体育要闻

王楚钦回应:找不回以前打球的感觉

娱乐要闻

去世刚2天,人民日报对刘欢的称呼改了

财经要闻

英伟达新增1500亿美元股票回购授权

汽车要闻

这台车开完还想开 智界RX最让我意外的,不是智驾,是操控

态度原创

房产
健康
教育
亲子
旅游

房产要闻

太意外!三亚重磅宅地,终止出让!

这些食物,可能正在偷偷养痘!

教育要闻

海洋科普舰队丨走进济宁,探索深蓝奇妙图鉴

亲子要闻

内行人建议:把运动外套换成它!

旅游要闻

不必远行寻诗,花溪扰绕山间,一田一寨皆是人间温柔光景!

无障碍浏览 进入关怀版