刚刚过去的这几天,科技圈最热闹的话题,莫过于一群"出题人"被逼着连夜改写考卷了。
这份考卷,叫ARC-AGI,是业界公认最能检验AI"是不是真的聪明"的一套测试。它考的既不是背题,也不是算数,而是让AI面对从没见过的小图形,现场猜出规律、举一反三。过去几年,别说考满分,很多顶尖模型连及格都费劲。
可一切在9月3号那天变了。
一觉醒来,AI从"半瓶水"考到"天花板"
OpenAI在9月3日发布了新一代旗舰模型GPT-6 Astra。它在ARC-AGI-3这套半私有测试集上,一口气拿到了99.9%的成绩。用OpenAI内部的话说,模型在这个维度上已经"完全饱和"了。
![]()
这个数字意味着什么?放到更早的版本里看就很直观——同一类测试,此前很多模型的成绩还是个位数。从"几乎不会"到"接近满分",这种跳跃被不少人形容成跨越式巨变,而不是普通的进步。
![]()
OpenAI联合创始人兼总裁格雷格·布罗克曼随即公开喊话:"欢迎来到AGI时代"。英伟达CEO黄仁勋也跳出来,抢先替行业宣布"AGI已经到来"。
一时间,"AGI实现了"的呼声铺天盖地。
掌声背后,藏着两个扎心的细节
不过,狂欢之余,有心人很快发现了两个疑点。
第一个疑点是分数本身。99.9%听着吓人,可它是在OpenAI定制的测试环境下跑出来的。一旦换成ARC Prize官方那套中立的统一接口,同一个模型、同一批题,成绩直接掉到62.7%,差了37个百分点。也就是说,换个考场,这份"满分答卷"立马打了六折。
![]()
第二个疑点更有意思。就在几天前,OpenAI首席执行官山姆·奥尔特曼还公开表示,AGI本质上就是个"营销术语"。同一个公司,一边说AGI是营销话术,一边高调宣布进入AGI时代,这让围观群众多少有点错愕。
![]()
更耐人寻味的是,黄仁勋的高调宣布也被不少分析视为醉翁之意不在酒——有人指出,这背后藏着推动算力需求、铺垫未来数十万颗GPU销量的现实考量。
出题人坐不住了:考卷得重做
平心而论,不管各方怎么吵,99.9%的成绩确实把AI的"刷题"能力推到了一个新的高度。而这就直接逼出了另一个尴尬问题:考卷,可能出不下去了。
因为ARC这套题原本的设计思路,就是靠"让AI面对从未见过的难题"来拉开人机差距。结果AI把分数刷到接近满分,原来的题海对模型来说已经失去了筛选意义。ARC Prize方面的原定测试方案,也随之被全盘作废,需要重新拟题。
![]()
就在今天(9月16日),ARC Prize创始人弗朗索瓦·肖莱正式披露了下一代评测蓝图:
ARC-AGI-4确认将在明年第一季度如期登场,方向聚焦更长时间尺度下的"持续学习";
而真正被称作"人类最后考卷"的ARC-AGI-5,已经全面提上日程。
下一关,考发明
这版"人类最后考卷"考什么?答案是:发明。
按目前的规划,ARC-AGI-5瞄准的"发明",很可能是想提前找到一道更难被刷穿的考题——它不再只是让AI解别人出的题,而是要让AI走出预设的解法套路,去创造出能被验证、能被反复使用的新东西。
换句话说,过去考的是"解题能力",下一关可能要考"造物能力"了。
这个方向看起来确实比单纯刷分难上不少。但问题也随之而来:这道"发明题"能守住多久,谁都说不准。
"考无可考",或许已不是玩笑
回过头看,围绕AGI的争论其实从未停歇。模型公司在晒跑分时闭口不谈定义,芯片巨头忙着宣布"时代到来",评测机构则死守"必须在标准条件下解题才算数"的底线,还有大厂按合同条款各算各的。各方口中的AGI,各说各话,至今没有一个公认的统一标准。
而当AI连"发明"这种开放性考题都要被拿来验证,甚至可能再次被超越时,那句曾经带着玩笑意味的"考无可考",恐怕就要从感慨变成AGI讨论里绕不开的真问题了。
AI还在加速狂奔。只是不知道,下一次面对新考卷的,到底会是谁先交卷——是模型,还是已经快出不动题的我们。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.