一个模型在综合智能测试里只拿了44分,却在真实世界任务中把一堆分数更高的对手踩在脚下。Apodex 刚发布的专有模型 Apodex 1.1,就制造了这么一出反差。
在 Artificial Analysis Intelligence Index 上,它的得分是44,谈不上亮眼。但换到衡量真实世界智能体工作的 GDPval-AA v2 上,它直接冲到1,348 Elo,超过多个通用智能分数更高的模型。
![]()
分数低,干活却猛
这种"考试不行、实战能打"的错位,指向一个老问题:综合指标和真实任务表现之间,可能没那么强的关联。Apodex 1.1 的选择,像是把宝押在了"把事情办成"而不是"把题答对"上。
对开发者来说,这倒是个提醒——挑模型别只看一个总分,得看它在你那个具体场景里到底行不行。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.