Agent Arena的帕累托前沿被改写了。GPT-6 Sol(Max)拿出了一个+7.7%的净改进,而每任务的中位成本只要0.75美元。
这个数字放在榜单上,冲击力来自对比。它距离Claude Fable 5(High)的+8.3%只差0.60个百分点,但每任务成本低了56%——0.75美元对1.72美元。
![]()
0.6个点,56%的钱
把这两组数字摆在一起看,逻辑就很清楚了。性能上,GPT-6 Sol(Max)没有登顶,它排在Claude Fable 5(High)后面,差距是0.60个百分点。成本上,它几乎砍掉了一半多的开销。
帕累托前沿的意思,就是在性能和成本这两个维度上,找不到另一个方案能同时占优。GPT-6 Sol(Max)这次进入的,正是这条边界线。
榜单上的位置怎么读
Agent Arena给出的信息很直接:
- 净改进:+7.7%
- 每任务中位成本:0.75美元
- 与Claude Fable 5(High)的性能差:0.60个百分点
- 与Claude Fable 5(High)的成本差:56%(0.75美元 vs 1.72美元)
这组数据说明的不是谁最强,而是谁在某个价位上更难被替代。多花一倍多的钱,换0.60个百分点的提升,这笔账怎么算,取决于具体任务对性能的敏感程度。
一次发布,两个坐标
Agent Arena在公布这条消息时,也向OpenAI团队表达了祝贺。对做Agent产品的团队来说,这条前沿线的移动意味着选型时多了一个参照点:性能不是唯一变量,成本同样是。
+7.7%和0.75美元,这两个数字放在一起,构成了GPT-6 Sol(Max)在Agent Arena上的坐标。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.