网易首页 > 网易号 > 正文 申请入驻

瑞士联邦理工学院发现:AI在这些"小学生级别"的题目前集体翻车

0
分享至


这项由瑞士联邦理工学院(EPFL)数学数据科学实验室领导的研究,以预印本形式于2026年7月9日发布,论文编号为arXiv:2607.08317v1,有兴趣深入了解的读者可以通过该编号在arXiv平台查询完整论文。

**一个让人忍俊不禁的现实**

现在的人工智能系统已经能够解答博士水平的数学题、通过各种职业资格考试、在国际象棋和围棋中击败世界冠军。各大科技公司也在各种标准测试榜单上你追我赶,每隔几个月就有新的"历史最高分"诞生。外界很容易产生一种印象:AI似乎已经无所不能了。

然而,瑞士联邦理工学院的研究团队发现,这些在标准考试中表现出色的AI,碰到一些连小学生都会的题目时,却会出人意料地犯难。比如,你让它写一段恰好31个字符的文字,它很可能数错。你让它画一只有五条腿的狗,它可能画出四条腿甚至六条腿的。你问它一张图片里有多少架飞机,它可能给你一个完全错误的答案。

这种反差并不罕见,研究团队认为,这恰恰说明现有的测试体系存在盲区——那些在标准考试中无法充分暴露的缺陷,在日常使用中却会频繁出现。正是为了系统地找出并量化这些盲区,他们设计了一套名为"blind-spots-bench"(盲点基准测试)的评测集,并对38个主流AI模型进行了全面评测。

**二、这套测试是怎么设计出来的**

理解这套测试的设计思路,可以用一个教室场景来类比。期末考试往往会考教材中的标准题型,一个擅长背题的学生可以拿高分,却不代表他真正理解了知识。EPFL的研究团队换了一种思路:他们让学生自己出题,专门挑那些"看起来简单、AI却答不对"的问题。

具体操作是这样的:研究人员在EPFL一门研究生级别的人工智能课程中,向全班学生布置了一项特殊任务——每人提交五道题,要求是"这道题人类轻松能答,但前沿AI答不对"。2025年10月前后,这门课的学生们陆续提交了约287道原始题目。

收集到原始题目之后,研究团队进行了严格的筛选和整理。他们去掉了重复的题目,也去掉了对人类来说也很难的题目(毕竟这个测试的核心是"人类容易、AI困难"的对比),还纠正了一些表述不清楚的问题,并为每道题设计了详细的参考答案。参考答案不只是给出正确结果,还明确了评判正确与否的标准,以及AI最容易犯的错误类型。最终,这个题库包含了235道经过精心筛选的题目,并在Hugging Face平台上公开发布。

这235道题按照输入输出的形式被分成三类。纯文字题占了最大比例,大约46.2%,输入是文字,输出也是文字,比如"写一段恰好31个字符的句子"。图片生成题占35.6%,要求AI根据文字描述画一张图,比如"画一只有五条腿的狗"。剩下18.2%是图文混合题,给AI看一张图并提出问题,比如"数一数这张照片里有多少架飞机"。

**三、题目背后的分类体系**

研究团队不只是堆砌了一堆题目,他们还构建了一套分类体系,把这些题目按照所考察的能力分门别类。这个分类体系就像一张能力地图,帮助我们理解AI在哪些方向上存在盲区。

整个体系分为三大类,第一类叫"以物体为中心的任务",考察AI对视觉世界的感知能力。这一类又细分为五个子方向:辨认属性与模式(比如在一张填字游戏图片里认出被标注出的单词)、空间推理(比如生成一张"沙发不接触地毯"的客厅图)、生成计数(比如画出恰好重复出现四次的圆形加三角形加正方形的组合)、感知计数(数一数图片里有多少棋子)、属性绑定(画出"两个g是红色、两个o分别是蓝色和绿色"的Google字样)。

第二类叫"抽象推理任务",考察AI的逻辑和数学能力。它包含逻辑推理(比如"如果每个正方形都是圆形,每个圆形都是三角形,那么正方形是什么形状")、算术推理(比如找到三个非零整数a、b、c使某个复杂等式成立)、几何与图推理(比如在一张带权重的有向图中找最短路径)、约束推理(比如解数独)。

第三类叫"语言与知识任务",考察AI对语言规则和常识的掌握。它包含无关信息干扰稳健性(考察AI是否会被题目中的干扰信息带偏)、字符级操作(精确控制字数或字符)、世界知识(比如画一张29天的二月日历)。

在这235道题目中,空间推理出现频率最高,共53次;其次是字符级操作,出现32次;感知计数出现21次;属性绑定出现30次;逻辑推理出现18次。这些高频率本身就很有说明意义——学生们自发选择了这些方向,说明他们在日常使用中也最常碰到AI在这些方面踩坑。

**四、评测机器是怎么运作的**

评测38个AI模型、每个模型要对235道题作答,如果全靠人工批改,工作量是惊人的。研究团队因此设计了一套自动评分流水线:先让被测试的AI作答,再用另一个AI(他们选择了谷歌的Gemini Flash轻量版)来批改答案。批改AI会拿到原始题目、被测AI的作答以及参考答案,最终给出"正确"或"错误"的二元判断。

当然,用AI批改AI的答案,本身就可能存在偏差。为了验证这套评分系统靠不靠谱,研究团队专门从中抽取了100多份作答样本,由人类和评分AI各自独立评判,然后对比两者的结论。结果显示,在纯文字类题目上,人机评判的一致率高达96.6%;在图片生成类题目上,一致率也有90.9%。这说明这套自动评分系统相当可靠。

此外,研究团队还特意检验了用谷歌的AI来批改是否会存在"裙带关系"——也就是对同属谷歌旗下的Gemini和Gemma模型打分更宽松。检验结果显示,没有发现明显的偏袒证据。有趣的是,反而是对非谷歌模型的评分略微偏宽松一点点,即把本来错误的答案误判为正确的比率,非谷歌模型稍高一些。但总体上这个差异不足以影响结论的可靠性。

在具体的测试配置上,所有被测模型都开启了"思考模式"(相当于让AI在回答前多想一想),且将最大输出长度设为32768个词元。每道文字题测四次取平均,图片生成题因成本较高只测一次。所有开源模型都通过EPFL的高性能计算平台部署运行,闭源商业模型则通过各自的API调用。

**五、榜单上的大赢家和大输家**

把所有结果汇总之后,一幅清晰的能力版图逐渐浮现出来。

在纯文字类题目上,表现最好的是两个闭源商业模型:谷歌的Gemini-3.1-Pro拿到了约83.3%的准确率,OpenAI的GPT-5.5拿到了约84%。这两个模型几乎并驾齐驱,稳居榜首。

开源模型中表现最好的是智谱的GLM-5.2,拿到了约74%的准确率。国产模型Qwen3.5-397B的表现也相当亮眼,文字题准确率约70%,而且还能处理图文混合题(准确率约48%),超越了不少体量更大的竞争对手,比如Kimi-K2.6和DeepSeek-V4-Pro。研究团队猜测这可能与Qwen3.5-397B的输出词元数普遍更多有关——它倾向于花更长时间"想清楚"再作答。

在图文混合类题目(同时给AI看图片和文字)上,差距进一步拉大。Gemini-3.1-Pro达到了约66.9%,而GPT-5.5只有约58.7%——文字题上的两强平分秋色,一到多模态任务,GPT-5.5就明显掉队了。

图片生成类题目的情况则完全是另一番景象。所有参与测试的图片生成模型准确率都不高,最好的谷歌Gemini-3-Pro-Image拿到了54.8%,OpenAI的GPT-Image-2则以51.2%紧随其后。Gemini-3-Pro-Image每测试100道题的费用约19.23美元,而GPT-Image-2的费用只要5.26美元,大约便宜了4倍,性价比明显更高。最早版本的GPT-Image-1-Mini只有19%,可见这个方向的模型进步非常明显,但整体上仍然相当受限。

**六、钱花在刀刃上:成本与效果的权衡**

研究团队还专门分析了"花多少钱能换多少准确率"这个实际问题,因为对于真正部署AI系统的人来说,成本是绕不开的考量。

结论可以用"收益递减"来概括——一开始多花钱能换来明显的准确率提升,但越到后来效果越差。具体来说,在文字题上,准确率从60%提升到70%,需要的成本增加大约10倍。在准确率相近的情况下,开源模型的单位成本往往远低于闭源商业模型。

DeepSeek-V4、Qwen3.5以及GLM-5.2在成本效益图上表现尤为突出——它们能以与Gemini-3.1-Flash-Lite或GPT-5.4-Mini相近的成本,取得更高的准确率。这对于需要大规模部署AI的企业或机构来说是个实用的参考信息。

谷歌Gemini-3系列的整体性价比在闭源阵营中也相当不错,尤其是在多模态任务上,在准确率和成本之间的平衡上优于GPT-5.4和5.5。

**七、工具调用这把双刃剑**

研究团队还做了一个很有意思的对照实验:给部分AI模型配备了Python代码执行工具,允许它在回答过程中最多调用五次代码,看看能否提升准确率。毕竟,很多盲点题目的难点恰恰在于精确计数或精确控制字符,而这些任务对代码来说其实易如反掌。

结果出乎意料地参差不齐。Gemini-3.1-Flash-Lite在启用代码工具后准确率提升了约9个百分点,GLM-5.1也提升了约7.6个百分点,GPT-oss-120b提升了约6.9个百分点。这些模型显然从工具中获益了。

然而,GPT-5.4启用代码工具后准确率反而下降了约5.3个百分点,Qwen3.5-397B也下降了约2.1个百分点。研究团队对这些失败案例做了定性分析,发现问题出在"虽然代码写得对,但输入处理出了岔子"——模型在把题目中的内容复制粘贴进代码时出错了。就好比一个人会用计算器,却把题目数字抄错了,结果算出一个完全错误的答案。这说明工具调用本身并不是万能的,模型还需要准确地"看懂题目"才能正确地使用工具。

**八、没有全能冠军:不同模型各有所长**

一个反复出现的模式是:没有哪个模型能在所有题型上都稳居第一。

对于图片生成模型来说,谷歌和OpenAI的旗舰版本总体准确率相近,但各有侧重。谷歌的Gemini系列在抽象推理类题目上更强,多赢了3道题;OpenAI的GPT-Image系列则在语言与知识类题目上略胜一筹。

在纯文字语言模型中,GPT-OSS开源版在数学相关任务上颇有竞争力,但在语言与知识的三个子类上落后于其他模型。DeepSeek-V4在字符级操作这一子类上格外出色,准确率高达75%。

在视觉语言模型(既能看图又能读文字的模型)中,GPT和Gemini系列组成了第一梯队。GPT在以物体为中心的任务上略逊于Gemini,但在抽象推理和语言知识上比Gemini稍强一些。Kimi系列在某些单项上表现亮眼,比如Kimi-K2.5在算术推理上达到了83%的高分,但在其他方向上与领先模型差距明显,比如在字符级操作上落后约10个百分点,整体稳定性不如GPT和Gemini系列。

感知计数这个子方向是所有模型共同的软肋。即便是最强的模型,在这个包含21道题的子类上也只有57.14%的准确率,许多模型的表现只有30%到40%。属性和模式识别更惨,只有6道题,最强模型也只答对了41.67%。简单说,你给AI看一张密密麻麻的照片让它数里面有多少飞机,它大概率会数错。

**九、模型越大越聪明?并非如此**

"更大的模型总是更好"是AI领域一个流行的直觉,这次的测试对这个直觉提出了挑战。

谷歌Gemma-4系列中,26B(260亿参数)的大版本在大多数子类上确实比5B的小版本强,但在"无关信息干扰稳健性"这一子类上,26B版本反而比E2B版本低了约8个百分点。换句话说,更大的模型在某些情况下更容易被无关信息带偏。

Qwen3.5系列的情况更明显。397B的最大版本在纯文字题上的整体准确率(约71%)确实高于35B版本(约64%)。但细看各子类,122B版本在逻辑推理、几何图推理、算术推理这三个子类上,准确率比35B版本低了10到14个百分点。397B版本虽然比122B有所恢复,但在这些子类上依然没有超过35B版本。这说明,同一个模型家族内部,随着参数量增加,整体表现可能提升,但某些具体能力可能反而退步——模型规模与特定能力之间的关系并不是简单的线性关系。

**十、现有测试体系跟不上真实能力的差距**

研究团队还做了一个颇有意思的横向对比:把各个模型在这套盲点测试中的成绩,与它们在"人工分析智能指数"(AAII)这个综合评测体系中的成绩进行比较。AAII是一个整合了十种主流文字测试(包括评估人类终极知识边界的"人类最后考试"和衡量指令遵循能力的IFBench等)的综合分数。

总体趋势上,两者确实正相关——在AAII上表现好的模型,在盲点测试上也倾向于表现得更好,说明盲点测试并不是毫无逻辑的刁钻题目,而是确实在考察某种真实能力。

但更关键的发现在于,开源模型和闭源模型之间存在系统性偏差。在AAII得分相近的情况下,开源模型在盲点测试上的成绩普遍低于闭源模型。研究团队对此给出了一个合理猜测:现有的标准公开测试集可能被用于模型训练或优化,使得模型在这些测试上显得更强,但这种强大并不能真正泛化到标准测试体系之外的新任务上。换句话说,开源模型可能更容易"刷题",而在真正陌生的任务面前,这种刷题获得的分数就不再有意义了。

**十一、这项研究的局限与未来**

研究团队在论文中坦诚地点出了这项工作的几个明显局限。

首先,235道题的体量相对有限,而且各子类的题目数量并不均衡——空间推理有53道,而属性和模式识别只有6道。样本太少会使某些子类的统计结论不够稳健。

其次,由于题目是由学生们专门针对2025年10月前后的主流前沿模型设计的,这个题库可能存在选题偏向——它更容易暴露当时那批模型的弱点,但未必能全面反映所有AI系统的通用短板。

再者,这套测试声称这些题目对人类来说很简单,但研究团队并没有正式进行人类基线测试——也就是说,目前还没有一批真实的人类参与者在同样条件下作答,来精确量化"人类有多简单、AI有多难"之间的差距。

尽管如此,这项工作的意义依然值得重视。它提供了一个有据可查的、可复现的方式来诊断AI系统的具体弱点,而不是只给出一个总分。对于任何考虑在教育、辅助技术、文档解析或人机协作等场景中部署AI系统的人来说,了解这些盲区在哪里,远比知道一个笼统的排名分数更有实际价值。

归根结底,这项研究做的事情相当于:在一场只考标准题型的考试中一直得高分的学生,被拉到真实生活场景里,发现他没法数清楚桌上有多少根蜡烛,也没法在便签纸上准确写出三十一个字符。标准考试考的是"学生知不知道解题套路",而盲点测试考的是"学生真正理解了没有"。

目前最好的闭源商业AI(如GPT-5.5和Gemini-3.1-Pro)在这套测试上的准确率达到了80%以上,这已经是个不小的进步。但与此同时,感知计数、属性识别等方向的准确率仍然卡在60%以下,说明人工智能系统在某些人类视为基础的感知能力上,仍然有着不可小觑的盲区。

这对普通用户意味着什么呢?当你请AI帮你数图片里的物体、控制文字的精确长度、或者按照复杂视觉要求生成图片时,最好还是保持一份额外的核对意识。现有的AI评测榜单高分并不保证它在这些具体任务上不犯错。盲点仍然存在,只是藏得更深了。

有兴趣深入研究这套评测体系的读者,可以通过arXiv:2607.08317v1查阅完整论文,相关数据集也在Hugging Face平台以CC-BY-4.0协议公开发布,评测代码托管在GitHub上,均可自由获取和复用。

Q&A

Q1:blind-spots-bench测试集中都有哪些类型的题目?

A:blind-spots-bench包含235道题,分三类:纯文字题(约46%)、图片生成题(约36%)和图文混合题(约18%)。题目涵盖感知计数、空间推理、字符级操作、逻辑推理、算术、约束推理等12个子类,核心特点是"对人类简单、对AI困难"。

Q2:GPT-5.5和Gemini-3.1-Pro在盲点测试上谁更强?

A:两者各有侧重。GPT-5.5在纯文字题上准确率约84%,略高于Gemini-3.1-Pro的83.3%;但在图文混合题上,Gemini-3.1-Pro以66.9%明显领先GPT-5.5的58.7%。综合来看,Gemini-3.1-Pro的整体表现更均衡,尤其在多模态任务上优势明显。

Q3:开源模型和闭源模型在盲点测试上的差距大吗?

A:差距约10个百分点。最好的开源模型GLM-5.2在文字题上约74%,而最好的闭源模型达到83-84%。更关键的是,即使在综合智能排名相近的情况下,开源模型在盲点测试上依然系统性地落后于闭源模型,说明开源模型可能存在"刷题"现象,在标准测试之外的新任务上泛化能力更弱。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“中伏忌两样,一年都安康”!明天中伏,这些禁忌别犯

“中伏忌两样,一年都安康”!明天中伏,这些禁忌别犯

简食记工作号
2026-07-24 01:36:33
苦命狗狗因长期疏于照顾失明,获救后首次拥有狗窝开心蹦跳

苦命狗狗因长期疏于照顾失明,获救后首次拥有狗窝开心蹦跳

Magic宠物社
2026-07-23 20:35:07
李小璐公开展示C-BLOCK手势!

李小璐公开展示C-BLOCK手势!

嘻笑堂
2026-07-23 02:24:01
重庆36万套挂牌压顶!远郊房价腰斩,五大’死亡板块’曝光

重庆36万套挂牌压顶!远郊房价腰斩,五大’死亡板块’曝光

童童聊娱乐啊
2026-07-24 13:06:36
杨紫海外团建照曝光,全网打工人集体“破防”

杨紫海外团建照曝光,全网打工人集体“破防”

情感大头说说
2026-07-24 12:15:23
人过60,永远不要在熟人面前,说以下6句话,谁说谁后悔

人过60,永远不要在熟人面前,说以下6句话,谁说谁后悔

有态度网友19Dsym
2026-07-24 14:49:23
仁爱礁交锋后,不到48小时,两国声援菲律宾,中方要求拖走坐滩舰

仁爱礁交锋后,不到48小时,两国声援菲律宾,中方要求拖走坐滩舰

陈莓特色体育解说
2026-07-23 16:23:24
中央统一标准!工龄15年、40年退休,每月差额一目了然

中央统一标准!工龄15年、40年退休,每月差额一目了然

小虎新车推荐员
2026-07-21 00:35:08
班主任说我考不上大学,撕了我的报名表,15年后他评特级教师,审批人是我

班主任说我考不上大学,撕了我的报名表,15年后他评特级教师,审批人是我

千秋文化
2026-07-20 19:12:29
人被抓走?美军惊慌失措,伊朗特种兵越境开打,枪决8名叛军司令

人被抓走?美军惊慌失措,伊朗特种兵越境开打,枪决8名叛军司令

今墨缘
2026-07-22 09:38:11
知名女星48岁生日,看《给阿嬷的情书》、吃潮汕菜,曾透露“阿嫲是潮汕人”

知名女星48岁生日,看《给阿嬷的情书》、吃潮汕菜,曾透露“阿嫲是潮汕人”

南方都市报
2026-07-24 14:04:25
鹿晗和关晓彤的新瓜,炸得太突然了

鹿晗和关晓彤的新瓜,炸得太突然了

黎兜兜
2026-07-08 08:12:39
施一公砸200亿建西湖大学,放话五年超过清华,8年过去反差太大

施一公砸200亿建西湖大学,放话五年超过清华,8年过去反差太大

小兰聊历史
2026-07-13 04:14:31
500万满仓科技,日亏仅2000多元?网红峰哥面对质疑喊冤:从未背叛科技,就买了5只股票,全部都是科技

500万满仓科技,日亏仅2000多元?网红峰哥面对质疑喊冤:从未背叛科技,就买了5只股票,全部都是科技

金融界
2026-07-24 16:01:53
美以伊最新局势:特朗普威胁对伊朗发动空前打击,称如果他提出要求,以色列“两分钟内就会加入”,伊朗、胡塞武装:已做好应战准备

美以伊最新局势:特朗普威胁对伊朗发动空前打击,称如果他提出要求,以色列“两分钟内就会加入”,伊朗、胡塞武装:已做好应战准备

鲁中晨报
2026-07-24 07:16:02
美国人都听不下去!澳外长要中国保证?见王毅秒变脸,中方不惯着

美国人都听不下去!澳外长要中国保证?见王毅秒变脸,中方不惯着

浅色夏么
2026-07-23 06:24:41
谢霆锋发声!否认父亲谢贤的遗产分配,为天后女友王菲打抱不平

谢霆锋发声!否认父亲谢贤的遗产分配,为天后女友王菲打抱不平

许三岁
2026-07-24 12:00:27
原来他们戏里戏外都是夫妻,恩爱几十年,如今45岁忙着拍戏不生娃

原来他们戏里戏外都是夫妻,恩爱几十年,如今45岁忙着拍戏不生娃

深析古今
2026-07-24 16:27:31
“这么小就有阴德纹,不简单!”小女孩意外走红,面相学果然权威

“这么小就有阴德纹,不简单!”小女孩意外走红,面相学果然权威

妍妍教育日记
2026-07-16 12:15:15
他是谢婷婷的现任丈夫,做家具生意还是北美总监,谢贤都夸他靠谱

他是谢婷婷的现任丈夫,做家具生意还是北美总监,谢贤都夸他靠谱

胡一舸南游y
2026-07-23 20:31:29
2026-07-24 19:08:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9308文章数 567关注度
往期回顾 全部

科技要闻

中国等了90年,王虹邓煜同时摘下菲尔兹奖

头条要闻

特朗普透露中国领导人访美期间双方议题 外交部回应

头条要闻

特朗普透露中国领导人访美期间双方议题 外交部回应

体育要闻

小布泽:越看越不像他爸爸

娱乐要闻

陈妍希姐姐到场追星张凌赫

财经要闻

长鑫科技会成为下一个“中石油”吗?

汽车要闻

主打年轻化/标配四激光雷达 岚图追光S预售30.99万元

态度原创

时尚
游戏
艺术
手机
军事航空

怎么会有人不Like Jennie?

《漫威金刚狼》琴葛蕾亮相被狂喷!玩家反怼:你是gay

艺术要闻

张旭秘藏的12条笔法秘诀,被颜真卿大白天下,外行练了也能成为大师!

手机要闻

OPPO K15图赏:岚影呼吸灯、8000mAh冰川电池、主动散热风扇

军事要闻

特朗普威胁对伊发动空前打击 伊朗、胡塞武装强势回应

无障碍浏览 进入关怀版