9 月 22 日,AI 安全中心(Center for AI Safety)和 Scale AI 发布 HLE-Diamond(人类最终考试·钻石版)。
这是从"人类最终考试"(Humanity's Last Exam, HLE)题库中精炼出的一个子集。
这套题库打磨了一年,共包含 1000 道精华题。
题目设计为闭卷可答,一半考推理,一半考专家级知识。
![]()
HLE是由 Center for AI Safety 和 Scale AI 联合推出的超高难度基准测试,于 2025 年初发布。
它面向全球各领域专家征集了约 3000 道题目,覆盖数学、物理、化学、生物、医学、法律、人文等上百个学科,题目前沿且小众,旨在成为"人类最后一批还能难住 AI 的考题"。
也就是说,当 AI 能在这套题上拿高分,就意味着在专家级任务上追平了人类。因此 HLE 如今被视为衡量前沿模型真实能力上限的标尺。
HLE-Diamond 就是目前最难、也最干净的一套 AI 测验。它不仅花了一年时间打磨,还联合研究社区进行了众包质检。
目前已上架 Hugging Face:cais/hle-diamond。
这次“ AI 高考”的结果如下:
排名
模型
得分
GPT-6 Astra
60.6%
Claude Opus 5.5
55.0%
Claude Fable 5.1
51.3%
4
Claude Opus 5
38.6%
5
Gemini 3.8 Flash
34.3%
6
GPT-6 Sol
33.8%
7
GPT-5.6 Sol
31.2%
8
Muse Spark 1.3
25.4%
9
Grok 4.7
23.4%
全场第一名,刚刚过及格线,60.6 分。
60 分这个数字,既是里程碑,更是清醒剂。
最近 Anthropic 、马斯克、山姆奥特曼都在传播“AI 末日论”,要“放缓前沿 AI 研”,但实际上,AI 赶人类的路还长着呢。
把成绩单拆成两半看,事情就更有意思了。
模型
推理题
知识题
GPT-6 Astra
75.6%
45.6%
Claude Opus 5.5
63.2%
46.8%
Claude Fable 5.1
62.0%
40.6%
发现没有?几乎所有模型都是推理分,明显高于知识分。也就是说,现在的 AI 思维很猛,但"肚里的墨水"还不够。
给它一个数学逻辑题,它能给你拆得明明白白;问它一个冷门的专业领域知识,它就开始一本正经地胡说八道。
这也给行业提了个醒,光靠强化学习把"推理链"练得再长,但expert knowledge(专家知识)的积累,依然是硬骨头。
如果说上面的成绩是"裸考",那接下来的操作就是——允许带工具(联网搜索 + 写代码跑程序)。
结果画风突变。
模型
裸考
带工具
GPT-6 Astra
60.6%
82.9%
Claude Opus 5.5
55.0%
73.9%
Claude Fable 5.1
51.3%
72.4%
Claude Opus 5
38.6%
69.1%
Gemini 3.8 Flash
34.3%
60.3%
平均暴涨 20 多个百分点,最强者直接冲破 80 分。
这组对比其实也点出了 2026 年 AI 竞赛的真正赛点。
模型本身的"裸实力"是一回事,会不会调用工具、会不会当 agent(智能体)干活,完全是另一回事。
一个会自己查资料、自己跑代码的 AI,战斗力是裸奔状态的数倍。
AI 的"大脑"还没装满,但"手脚"已经越来越麻利了。
但是只有当某一天,AI 在这张卷子上裸考也能拿高分,那可能才是真正的"奇点临近"。
(数据来源:Center for AI Safety & Scale AI,2026.09.22所有模型均在 reasoning high 模式下评估)
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.