GPT-6 Astra 9月3日发布,分数还没焐热就开始变。
Fortune追踪到:官方博客里Astra幻觉率先是4.2%,下午改到2%,被问及后又回到4.2%;前代GPT-5.6 Sol从12.2%降到9.4%再回12.2%。ARC-AGI-3媒体草案98.6%,上线99.99%;用OpenAI自带框架跑99.9%,ARC Prize标准评测框架下62.7%,同167关、算力约2.6万美元。ExploitBench标100%,GPT-5.6 Sol 78.5%;GPQA Diamond Astra 96%,Claude Opus 5是94.2%、Gemini 3.1 Pro 94.3%。Artificial Analysis智能指数Astra 61.2,Claude Fable 5.1 66——发布PPT和第三方排行,已经不是一个排序。
争议不在“造假”。斯坦福Anka Reuel、Mike Hardy说的词是benchmaxxing:换推理档、调工具配置、反复跑取最优,系统卡连测试项数都没写清。分数测的早已不是纯模型,是“模型+API设置+记忆+脚手架”一整套。同一模型,框架一换差37分,排行榜的可比性先塌了。
大厂要AGI叙事,媒体要峰值数字,客户要敢不敢用。发布会PPT越来越像营销稿——真实能力得看独立复测、看长任务完成率、看错题会不会编。信任不是跑出来的,是可复核出来的。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.