网易首页 > 网易号 > 正文 申请入驻

Claude Opus 5 在人工智能分析指数中荣登世界顶级模型榜首,击败了 Fable 5。

0
分享至


来源:https://officechai.com/ai/claude-opus-5-becomes-top-model-in-the-world-on-artificial-analysis-intelligence-index-beats-fable-5/

Anthropic 刚刚推出了一款超越其之前最佳公开销售型号的产品——而且价格只有之前的一半。

Claude Opus 5以 61 分的成绩首次登上人工智能分析智能指数榜首,超越了 Claude Fable 5 的 60 分,并将 GPT-5.6 Sol 挤到了第三位,后者得分为 59 分。从表面上看,第一名和第二名之间仅相差一分,但这一分背后的意义才使这一结果引人注目。


克劳德·奥普斯 5 人工智能分析智能指数

Opus 5 是一款独立且完全可用的模型,任何人都可以通过 API 调用,其得分为 61 分。Anthropic 能够超越其目前受监管限制的旗舰产品固然令人瞩目,但更重要的是,Anthropic 表示 Opus 5 的价格仅为 Fable 单次任务成本的一半。对于任何决定基于哪个模型进行开发的人来说,这才是真正重要的。

田野其他部分的位置

过去一个月,该指数的竞争明显加剧。GPT -5.6 Sol以 59 分位列榜首,紧随 Fable 的备用模型之后;Moonshot AI 的Kimi K3以 57 分紧随其后——对于一款开放权重模型而言,能够与今年最受关注的两款封闭权重模型竞争,这无疑是一个相当不错的成绩。Grok 4.5位列 54 分,GLM-5.2 和 Meta 的 Muse Spark 1.1 并列 51 分,Gemini 3.6 Flash 以 50 分位列榜首,成为得分超过 50 分的模型之一。

在这个分数段以下,DeepSeek V4 Pro 和 MiniMax-M3 并列第 44 分,Nvidia 的 Nemotron 3 Ultra 位列第 38 分,而 gpt-oss-120b 则垫底,仅排名第 24。纵观整个排行榜,最引人注目的是,现在有如此多的实验室的得分超过了 50 分。几个月前,这个分数线是区分领先者和其余所有厂商的分界线。而现在,已有六家不同的实验室推出了得分高于 50 分的显卡,第一名和第五名之间的差距也缩小到了个位数。

代理知识工作数据比总体得分更引人注目

在Artificial Analysis的评估中,更具决定性的结果并非智能指数,而是GDPval-AA v2。该指标使用Artificial Analysis的开源参考代理框架Stirrup来衡量模型在实际专业知识工作中的表现。Opus 5(最高分)在该指标上获得了1861 Elo评分,比Fable 5和GPT-5.6 Sol高出100多分,比Fable 5高出114分以上。在Artificial Analysis自主研发的智能体知识工作基准测试AA-Briefcase上,Opus 5获得了1720 Elo评分,比Fable 5高出146分。这两项结果都表明,Opus 5以绝对优势成为智能体专业知识工作领域的新领军者,这与在综合指数上仅以一分之差险胜竞争对手截然不同。

编码性能同样表现出色。在 Claude Code 中以 xhigh 难度运行,Opus 5 在人工智能分析编码代理指数 (ACI) 中并列第一,并在 SWE-Atlas-QnA 测试中取得了所有模型中的最高分。在用于测试代理终端使用的 Terminal-Bench v2.1 测试中,Opus 5 在最高难度下达到了 89% 的准确率,与目前领先的 GPT-5.6 Sol 在 xhigh 难度下的表现大致相当。

Opus 5 未曾提及之处

Anthropic 的模型并非在所有方面都领先,Artificial Analysis 的分析也相当直接地指出了它的不足之处。在“人类的最后考试”(Humanity's Last Exam)测试中,Opus 5 的得分为 53%,与 Fable 5 持平,而非领先。在由阿贡国家实验室和伊利诺伊大学厄巴纳-香槟分校的研究人员开发的前沿物理评估测试 CritPt 中,它的表现也与 Fable 5 相当,但落后于 GPT-5.6 Sol、GPT-5.5 Pro 和 GPT-5.6 Terra。

事实 知识方面的差距更为显著。在AA-Omniscience测试中,Opus 5的准确率比Opus 4.8提高了7个百分点,但仍然落后于Fable 5——人工智能分析将这种差异归因于模型规模的相对大小。一旦考察Opus 5如何处理不确定性,这种权衡就更加明显:它在不确定时会更频繁地给出答案而不是拒绝,但其在同一基准测试中的幻觉率上升了14个百分点,达到50%。人工智能分析还指出,Opus 5的效率提升仅在高智能/成本曲线的高端才真正显现出来——在较低的工作量设置下,对于给定的智能水平,其单项任务成本仅略低于GPT-5.6系列。

工作量设定、背景和定价

Opus 5 提供五种难度设置——低、中、高、超高和最高——人工智能分析发现它们之间的差距异常大。仅在 GDPval-AA v2 数据集上,从低难度到最高难度就跨越了 407 个 Elo 分数,输出令牌的使用量也随之增长了约 8 倍。这与 GPT-5.6 Sol 在其自身难度设置下的表现类似,这意味着 Opus 5 的运行成本可以远低于其他实验室的模型,或者性能可以远超其他实验室的模型,这完全取决于开发者如何配置它。


该模型采用 100 万个代币的上下文窗口,与 Opus 4.8 版本一致,并保持与前代产品相同的每百万个代币输入 5 美元/每百万个代币输出 25 美元的定价。缓存写入的溢价为每百万个代币 6.25 美元,比上一代产品高出 25%,生存时间为 5 分钟;缓存命中则享受 90% 的折扣,降至每百万个代币 0.50 美元。Opus 5 也支持服务器端回退机制,该机制与 Fable 5 在出口管制限制下保持在线的机制相同。

为什么价格角度比点差更重要

在基准指数中领先一分并不能说明全部问题,Anthropic 比榜单上的大多数实验室都更清楚这一点。Opus 5 的改变在于权衡取舍的模式。Fable 5 是 Anthropic 对原始能力的回应,其定价和准入门槛也与之相符。Opus 5 的定位是能够以极低的单项任务成本,提供几乎相同的能力,并且无需通过备用方案即可独立运行,同时在对企业部署至关重要的智能知识工作和编码基准测试中遥遥领先。鉴于智能指数榜首的竞争如此激烈,实验室之间真正的竞争指标正迅速从总分本身转变为每点智能的成本。

这是一个值得关注的变化。以前各实验室的得分差距较大时,领先三四分意味着实实在在的优势。而现在,六家实验室的得分都相差不到十分,因此,得分61分且成本比得分60分的模型低26%的模型,无疑更具说服力,无论本周哪个模型在技术层面上名列榜首。

阅读最新前沿科技趋势报告,请访问21世纪关键技术研究院的“未来知识库”


未来知识库是 “21世纪关键技术研究院”建 立的在线知识库平台,收藏的资料范围包括人工智能、脑科学、互联网、超级智能,数智大脑、能源、军事、经济、人类风险等等领域的前沿进展与未来趋势。目前拥有超过8000篇重要资料。每周更新不少于100篇世界范围最新研究资料。 欢迎扫描二维码或访问https://wx.zsxq.com/group/454854145828进入。

截止到2月28日 ”未来知识库”精选的百部前沿科技趋势报告

(加入未来知识库,全部资料免费阅读和下载)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
一场演习敲响警钟!歼16在埃及追着阵风打,新德里这次真坐不住了

一场演习敲响警钟!歼16在埃及追着阵风打,新德里这次真坐不住了

命运天注定
2026-08-26 09:57:32
CCTV5播中国男篮VS卡塔尔,国内0点比赛,郭士强明牌,杨瀚森焦虑

CCTV5播中国男篮VS卡塔尔,国内0点比赛,郭士强明牌,杨瀚森焦虑

体育大学僧
2026-08-26 11:29:05
4票对3票,联合国选举反转,亲美候选人垫底,联大反华主席失算

4票对3票,联合国选举反转,亲美候选人垫底,联大反华主席失算

云上乌托邦
2026-08-25 18:45:07
下个月偏财运最好!这3生肖有喜临门,副业越做越大,一路畅通

下个月偏财运最好!这3生肖有喜临门,副业越做越大,一路畅通

毅谈生肖
2026-08-26 11:45:26
杨超越在工厂打工时候的照片曝光!网友炸了:这妥妥的厂花啊!

杨超越在工厂打工时候的照片曝光!网友炸了:这妥妥的厂花啊!

黎兜兜
2026-08-25 22:25:21
明天夜间到后天白天,北京还有一场雨!周末适宜出行

明天夜间到后天白天,北京还有一场雨!周末适宜出行

北青网-北京青年报
2026-08-26 13:51:21
斯诺克赛程:决出8强,中国2将PK世界冠军,肖国栋冲纪录,赵心童复仇战!

斯诺克赛程:决出8强,中国2将PK世界冠军,肖国栋冲纪录,赵心童复仇战!

刘姚尧的文字城堡
2026-08-26 06:52:09
“她是桃花眼,前途不敢估量”,女孩考上中山大学,面相火了

“她是桃花眼,前途不敢估量”,女孩考上中山大学,面相火了

世界圈
2026-08-21 09:05:40
人狂必有祸!公安部出手,甲醛白菜当事人再迎噩耗,这下麻烦大了

人狂必有祸!公安部出手,甲醛白菜当事人再迎噩耗,这下麻烦大了

金哥说新能源车
2026-08-26 00:39:04
重庆警方凌晨发布警情通报

重庆警方凌晨发布警情通报

政知新媒体
2026-08-26 08:02:55
小学生作文《热死了》走红,老师看后直接给满分:我拜你为师吧!

小学生作文《热死了》走红,老师看后直接给满分:我拜你为师吧!

谭老师地理大课堂
2026-08-13 01:17:31
【油价大降】近1.2元/升,全国95汽油“6连涨、接近9.5元/升”后降下来,下次8月28日调价,预涨390元/吨!

【油价大降】近1.2元/升,全国95汽油“6连涨、接近9.5元/升”后降下来,下次8月28日调价,预涨390元/吨!

猪友巴巴
2026-08-26 09:26:35
重大考验!国足即将出战世界杯球队新西兰:有望召入大量新国脚

重大考验!国足即将出战世界杯球队新西兰:有望召入大量新国脚

邱泽云
2026-08-26 15:08:49
金相植:现在只剩一场比赛,决赛将载入越南足球史册

金相植:现在只剩一场比赛,决赛将载入越南足球史册

懂球帝
2026-08-26 17:06:42
宋丹丹林大竣连续16年一起庆生,周冬齐发文:16年和大竣一起过生日,在我们身处困境时永远伸出援手

宋丹丹林大竣连续16年一起庆生,周冬齐发文:16年和大竣一起过生日,在我们身处困境时永远伸出援手

韩小娱
2026-08-26 11:14:47
俄媒:随着“宁德舰”正式服役,中国海军现在已拥有46艘054A型护卫舰

俄媒:随着“宁德舰”正式服役,中国海军现在已拥有46艘054A型护卫舰

零度Military
2026-08-26 06:56:31
女孩穿“异形西装”考公面试,高分被刷,网友:拖地裤子太过分

女孩穿“异形西装”考公面试,高分被刷,网友:拖地裤子太过分

泽泽先生
2026-08-16 12:32:26
侍卫救了乾隆的命,乾隆问他要何赏赐?侍卫:就赏我两个宫女吧

侍卫救了乾隆的命,乾隆问他要何赏赐?侍卫:就赏我两个宫女吧

千秋文化
2025-12-26 18:39:21
一对情侣亲密时,男的不愿带小雨伞,女的也没强迫男的穿

一对情侣亲密时,男的不愿带小雨伞,女的也没强迫男的穿

趣味萌宠的日常
2026-08-24 06:38:53
全线失血的阿里,吓坏资本市场!

全线失血的阿里,吓坏资本市场!

功夫财经
2026-08-26 08:02:55
2026-08-26 22:28:49
人工智能学家 incentive-icons
人工智能学家
人工智能领域权威媒体
5006文章数 37516关注度
往期回顾 全部

科技要闻

DeepSeek被曝前七个月收入4.75亿元

头条要闻

男子未领证办婚礼后离世留400万财产 女方要求分200万

头条要闻

男子未领证办婚礼后离世留400万财产 女方要求分200万

体育要闻

兑现五年之约,含梗量最高的世界冠军诞生

娱乐要闻

包文婧当初担心包贝尔出轨,预言成真

财经要闻

洪灏:人民币是全球最被低估的货币

汽车要闻

硬派增程SUV新选手 北汽泰钽700上市焕新价24.98万起

态度原创

时尚
本地
健康
数码
军事航空

告别黑白灰,秋天穿“这个颜色”减龄又好看

本地新闻

无印良品竟是桐乡造?这座小城藏着一个刀具帝国

孩子刷短视频成瘾?9大成瘾真相

数码要闻

三星在2026年科隆游戏展发布P9、P7便携式SSD 全面转向USB4

军事要闻

特朗普赞赏后 三个美国盟友邀请伊朗加入"中东版北约"

无障碍浏览 进入关怀版