AI能力评测圈最近有个不小的动作。Artificial Analysis发布的Intelligence Index v4.2,直接砍掉了曾经被视为“硬骨头”的GPQA Diamond基准测试,同时新增了两个更贴近真实工作场景的测试集。这个调整背后,是评测机构对“AI到底能干什么”这件事的重新思考。
这次更新的核心逻辑很简单:评测必须跟上AI能力的进化速度。v4.2被官方定位为v5路线图的加速版,重点转向长周期任务(long-horizon tasks)——这类任务更接近现实世界中的问题解决过程,而不是实验室里那种一问一答的短对话。
![]()
为什么砍掉GPQA Diamond?
GPQA Diamond曾是衡量前沿模型推理能力的标杆,但这次被移除的原因很直接:它对顶尖模型已经“饱和”了。换句话说,头部模型在这个测试上的分数差距越来越小,区分度大幅下降。更关键的是,它的选择题格式和真实工作场景中的任务形态相去甚远——现实里没人会给你四个选项让你选答案。
这其实暴露了AI评测的一个老问题:测试集和真实应用之间的鸿沟。模型在基准测试上拿高分,不代表它能在实际工作中靠谱。v4.2的调整,本质上是在缩小这个差距。
新增两大测试:更接近“真实工作”
v4.2引入了两个新基准,都指向同一个方向——让AI做更复杂、更真实的事。
第一个叫AA-Briefcase,这是一个面向长周期智能体知识工作的基准测试,配备了私有测试集。所谓“长周期智能体”,就是让AI像人类员工一样,在一个任务上持续工作较长时间,而不是简单回答几个问题。私有测试集的设计则能有效防止模型通过“刷题”来刷分——测试数据不公开,模型没法提前“背答案”。
第二个叫GDP.pdf,专门测试模型在数千份真实文档上的长上下文推理能力。这个测试模拟的是分析师、律师、研究员这类职业的日常工作——面对堆积如山的文档,快速定位关键信息并做出判断。这类任务对模型的上下文窗口和信息检索能力提出了更高要求。
评测逻辑变了:从“考试”到“干活”
这次更新透露出的信号很明确:AI评测正在从“考试模式”转向“干活模式”。传统的基准测试像是一场标准化考试,题目固定、答案明确,模型可以通过针对性训练来提升分数。但真实世界的工作不是这样的——任务模糊、信息庞杂、需要持续推理和决策。
官方在公告中解释了加速更新的原因:Intelligence Index需要衡量AI的真实能力,才能对做决策的开发者有用。这句话点出了评测的根本目的——不是给模型排名次,而是给开发者提供决策依据。如果评测指标和实际应用脱节,那这个指标对开发者的参考价值就大打折扣。
对开发者的实际影响
这次更新对正在选型或评估模型的开发者来说,有几个值得关注的要点:
- 评测参考价值提升:新增的AA-Briefcase和GDP.pdf更贴近真实工作负载,评测分数对实际选型的参考意义更大。
- “刷分”空间被压缩:私有测试集的引入,意味着模型无法通过记忆公开测试数据来获得虚高分数。
- 长上下文能力成为新焦点:GDP.pdf的加入,说明长文档处理能力正在成为AI能力评估的重要维度。
当然,这次更新也留下了一些悬念。v5路线图的完整内容尚未公布,官方表示“随着v5的持续推出,还会有进一步更新”。从v4.2的调整方向来看,更真实、更难“作弊”、更贴近实际应用,大概率是后续版本的主基调。
对于关注AI能力边界的人来说,这次更新提供了一个更清晰的观察窗口——AI评测正在从“考高分”转向“干实事”,这或许比任何单一模型的分数提升都更有意义。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.