在人类智力分布的标尺上,130 分是一道醒目的金线。全球心理学家公认,达到这个分数意味着进入"天才"区间——只有不到 2% 的人能站上这个位置。而就在 7 月 16 日,一台大模型第一次把这条线踩在了脚下。
Tracking AI 最新公布的离线 IQ 测试结果显示,OpenAI GPT-5.6 整个 SOL 和 TERRA 家族一致拿到了 136 分。这是大语言模型首次突破 130 分的天才门槛,比此前所有模型都高出一截。
![]()
堵住作弊漏洞的"真考场"
Tracking AI 手里有两套 IQ 测试题。一套是公开的 Mensa Norway 风格题库,模型们早就通过各种渠道刷到了 140 多分,这套题已经彻底失去了区分度。另一套是不公开、不联网、无法被爬虫抓取的"离线题库",专门用来堵住模型提前背答案的后门。
GPT-5.6 这次突破的正是这套最硬的离线题。136 分的成绩不仅跨过了 130 的分水岭,也把紧随其后的 Claude-5 Fable(130 分)甩开了一段距离。再往下看,GPT-5.6 LUNA Max 和 Claude-4.8 Opus 还在 117 到 123 分之间徘徊。近一年来,从 o3 到各家旗舰,一波又一波模型撞上 130 这堵墙,GPT-5.6 是第一个把它撞开的。
高分背后,实战才是硬道理
智力测试说到底只是纸上谈兵。开发者们把 GPT-5.6 拉去真刀真枪干活后的反馈,给出了另一半答案。
开发者 Amir Bohlooli 用一个物理模拟指令同时测试了 Fable5 和 GPT-5.6 Sol。他原本以为 Fable5 会完胜,结果 GPT-5.6 选择了粒子流体模拟方案,物理引擎按真实时间推进,CSS、界面、渲染全部塞进一个 HTML 文件,还自动托管成可分享的网页——一句话,造出了一个成品。
另一位开发者 Ramanpal Singh 用一句提示词,搭建了一套完整的基于 RAG 的客服工单系统。这套系统包含四种角色、管理后台、自动投诉分类和情绪识别功能。他一口气做了 5 个类似的应用,成本只有 Fable5 的零头。
Claire Vo 的经历更让人有代入感。她被一个 bug 卡住,以为是自己代码写错了。换成 GPT-5.6 Sol 后丢了一句"我就不信搞不定",Sol 一次性修好,还顺手帮其他模型也跑通了。她的评价很犀利:Fable 死磕技术上的精确反而作茧自缚,Sol 的务实反倒把活干成了。
有网友在看完这些测试后感叹:"对 99% 的人来说,这已经是 AGI 了。"
天才分数的另一面
不过,136 分的 IQ 测试测的主要是抽象模式识别和逻辑推理——说白了,是一种"标准化认知"。这类测试虽然能反映大模型在受控条件下的推理上限,但测不出事实可靠性、工具调用的稳定程度,以及在真实职业场景中的靠谱程度。
但不可否认的是,人们在实际使用中得到的反馈正在拼凑出另一幅图景:GPT-5.6 正在把"会做题"和"会做事"这两件事慢慢拧到一起。那些模型从没见过、无处可抄答案的全新问题,才是检验"智力"的真正试金石。
人类的天才线被一台机器跨过了。这并不意味着 AI 已经全能,但它确实说明——在模拟人类推理这件事上,我们比任何时候都更接近起跑线。
如果觉得这篇文章值得一读,欢迎点个「推荐」;这些思考我会持续整理出来,欢迎关注,后续咱们慢慢聊。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.