OpenAI 刚刚甩出了一份让整个行业沉默的基准成绩单。GPT-6 Astra 在 FrontierMath Tier 4 v2 上拿下 97.6%,在 ExploitBench 上更是直接拉满 100%。这不是挤牙膏式的进步,是断层式的跳跃。
五项硬核基准,几乎全绿
![]()
除了上述两项,它在 GPQA Diamond 上得分 96%,在 BenchCAD 上得分 95.9%,DeepSWE v1.1 也拿到了 74.1%。唯一带星号的是 ARC-AGI-3,报告成绩为 98.6%,但官方明确标注了“reported”,且图片提示该数字带有重要限定条件——目前排行榜上传统前沿模型的成绩远低于此,但直接对比并不公平。
别急着高潮,先看这个限定条件
ARC-AGI-3 的 98.6% 看着吓人,但官方自己都承认“对比并不直接”。这就像拿开卷考试成绩和闭卷考试比,分数好看,但含金量得打个问号。其他几项倒是实打实的硬通货,尤其是 ExploitBench 的满分,意味着它在漏洞利用这类实战任务上已经无解。
Greg Brockman 已经按捺不住了
OpenAI 联合创始人 Greg Brockman 直接放话:这可能是 AGI 的到来,是一次 generational leap(代际飞跃)。虽然这话从他嘴里说出来自带立场,但配合这组数据,确实让人没法不当回事。
新模型计划在未来几天内面向付费 ChatGPT 订阅用户和 API 开放。到时候是骡子是马,拉出来遛遛就知道了。反正这波,OpenAI 是把饼画得又大又圆了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.