![]()
来源:https://officechai.com/ai/claude-opus-5-becomes-top-model-in-the-world-on-artificial-analysis-intelligence-index-beats-fable-5/
Anthropic 刚刚推出了一款超越其之前最佳公开销售型号的产品——而且价格只有之前的一半。
Claude Opus 5以 61 分的成绩首次登上人工智能分析智能指数榜首,超越了 Claude Fable 5 的 60 分,并将 GPT-5.6 Sol 挤到了第三位,后者得分为 59 分。从表面上看,第一名和第二名之间仅相差一分,但这一分背后的意义才使这一结果引人注目。
![]()
克劳德·奥普斯 5 人工智能分析智能指数
Opus 5 是一款独立且完全可用的模型,任何人都可以通过 API 调用,其得分为 61 分。Anthropic 能够超越其目前受监管限制的旗舰产品固然令人瞩目,但更重要的是,Anthropic 表示 Opus 5 的价格仅为 Fable 单次任务成本的一半。对于任何决定基于哪个模型进行开发的人来说,这才是真正重要的。
田野其他部分的位置
过去一个月,该指数的竞争明显加剧。GPT -5.6 Sol以 59 分位列榜首,紧随 Fable 的备用模型之后;Moonshot AI 的Kimi K3以 57 分紧随其后——对于一款开放权重模型而言,能够与今年最受关注的两款封闭权重模型竞争,这无疑是一个相当不错的成绩。Grok 4.5位列 54 分,GLM-5.2 和 Meta 的 Muse Spark 1.1 并列 51 分,Gemini 3.6 Flash 以 50 分位列榜首,成为得分超过 50 分的模型之一。
在这个分数段以下,DeepSeek V4 Pro 和 MiniMax-M3 并列第 44 分,Nvidia 的 Nemotron 3 Ultra 位列第 38 分,而 gpt-oss-120b 则垫底,仅排名第 24。纵观整个排行榜,最引人注目的是,现在有如此多的实验室的得分超过了 50 分。几个月前,这个分数线是区分领先者和其余所有厂商的分界线。而现在,已有六家不同的实验室推出了得分高于 50 分的显卡,第一名和第五名之间的差距也缩小到了个位数。
代理知识工作数据比总体得分更引人注目
在Artificial Analysis的评估中,更具决定性的结果并非智能指数,而是GDPval-AA v2。该指标使用Artificial Analysis的开源参考代理框架Stirrup来衡量模型在实际专业知识工作中的表现。Opus 5(最高分)在该指标上获得了1861 Elo评分,比Fable 5和GPT-5.6 Sol高出100多分,比Fable 5高出114分以上。在Artificial Analysis自主研发的智能体知识工作基准测试AA-Briefcase上,Opus 5获得了1720 Elo评分,比Fable 5高出146分。这两项结果都表明,Opus 5以绝对优势成为智能体专业知识工作领域的新领军者,这与在综合指数上仅以一分之差险胜竞争对手截然不同。
编码性能同样表现出色。在 Claude Code 中以 xhigh 难度运行,Opus 5 在人工智能分析编码代理指数 (ACI) 中并列第一,并在 SWE-Atlas-QnA 测试中取得了所有模型中的最高分。在用于测试代理终端使用的 Terminal-Bench v2.1 测试中,Opus 5 在最高难度下达到了 89% 的准确率,与目前领先的 GPT-5.6 Sol 在 xhigh 难度下的表现大致相当。
Opus 5 未曾提及之处
Anthropic 的模型并非在所有方面都领先,Artificial Analysis 的分析也相当直接地指出了它的不足之处。在“人类的最后考试”(Humanity's Last Exam)测试中,Opus 5 的得分为 53%,与 Fable 5 持平,而非领先。在由阿贡国家实验室和伊利诺伊大学厄巴纳-香槟分校的研究人员开发的前沿物理评估测试 CritPt 中,它的表现也与 Fable 5 相当,但落后于 GPT-5.6 Sol、GPT-5.5 Pro 和 GPT-5.6 Terra。
事实 知识方面的差距更为显著。在AA-Omniscience测试中,Opus 5的准确率比Opus 4.8提高了7个百分点,但仍然落后于Fable 5——人工智能分析将这种差异归因于模型规模的相对大小。一旦考察Opus 5如何处理不确定性,这种权衡就更加明显:它在不确定时会更频繁地给出答案而不是拒绝,但其在同一基准测试中的幻觉率上升了14个百分点,达到50%。人工智能分析还指出,Opus 5的效率提升仅在高智能/成本曲线的高端才真正显现出来——在较低的工作量设置下,对于给定的智能水平,其单项任务成本仅略低于GPT-5.6系列。
工作量设定、背景和定价
Opus 5 提供五种难度设置——低、中、高、超高和最高——人工智能分析发现它们之间的差距异常大。仅在 GDPval-AA v2 数据集上,从低难度到最高难度就跨越了 407 个 Elo 分数,输出令牌的使用量也随之增长了约 8 倍。这与 GPT-5.6 Sol 在其自身难度设置下的表现类似,这意味着 Opus 5 的运行成本可以远低于其他实验室的模型,或者性能可以远超其他实验室的模型,这完全取决于开发者如何配置它。
![]()
该模型采用 100 万个代币的上下文窗口,与 Opus 4.8 版本一致,并保持与前代产品相同的每百万个代币输入 5 美元/每百万个代币输出 25 美元的定价。缓存写入的溢价为每百万个代币 6.25 美元,比上一代产品高出 25%,生存时间为 5 分钟;缓存命中则享受 90% 的折扣,降至每百万个代币 0.50 美元。Opus 5 也支持服务器端回退机制,该机制与 Fable 5 在出口管制限制下保持在线的机制相同。
为什么价格角度比点差更重要
在基准指数中领先一分并不能说明全部问题,Anthropic 比榜单上的大多数实验室都更清楚这一点。Opus 5 的改变在于权衡取舍的模式。Fable 5 是 Anthropic 对原始能力的回应,其定价和准入门槛也与之相符。Opus 5 的定位是能够以极低的单项任务成本,提供几乎相同的能力,并且无需通过备用方案即可独立运行,同时在对企业部署至关重要的智能知识工作和编码基准测试中遥遥领先。鉴于智能指数榜首的竞争如此激烈,实验室之间真正的竞争指标正迅速从总分本身转变为每点智能的成本。
这是一个值得关注的变化。以前各实验室的得分差距较大时,领先三四分意味着实实在在的优势。而现在,六家实验室的得分都相差不到十分,因此,得分61分且成本比得分60分的模型低26%的模型,无疑更具说服力,无论本周哪个模型在技术层面上名列榜首。
阅读最新前沿科技趋势报告,请访问21世纪关键技术研究院的“未来知识库”
![]()
未来知识库是 “21世纪关键技术研究院”建 立的在线知识库平台,收藏的资料范围包括人工智能、脑科学、互联网、超级智能,数智大脑、能源、军事、经济、人类风险等等领域的前沿进展与未来趋势。目前拥有超过8000篇重要资料。每周更新不少于100篇世界范围最新研究资料。 欢迎扫描二维码或访问https://wx.zsxq.com/group/454854145828进入。
截止到2月28日 ”未来知识库”精选的百部前沿科技趋势报告
(加入未来知识库,全部资料免费阅读和下载)
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.