网易首页 > 网易号 > 正文 申请入驻

Opus 5反超Fable 5,Anthropic 的定价牌局被打乱了?

0
分享至

来源:市场资讯

(来源:钛媒体AGI)


半价跑赢旗舰。

作者|AGI-Signal

编辑|秦聪慧

本文首发于钛媒体APP

7月25日凌晨1点,Anthropic 发布了 Claude Opus 5。如果只看名字,你会以为它是 Opus 4.8 的继任者,Anthropic 产品线中比 Sonnet 强但比 Fable 弱的中间型号。

但一看数据就会发现,这款定价 $5/$25(每百万输入/输出 token)的模型,在编程、自主搜索、计算机使用、企业业务流程等多个关键基准测试上,把定价 $10/$50 的 Fable 5 给超了。而它的成本,只有 Fable 5 的一半。

Anthropic 在官方公告里表示:“Opus 5 comes close to the frontier intelligence of Claude Fable 5 at half the price”,意思是接近 Fable 5 的智能,价格减半。但他们自己发布的基准测试图表显示,Opus 5 在至少四项核心评测中明确领先 Fable 5,而且是在更低的成本下做到的。

1

被“次旗舰”反超的“旗舰”

先看编程能力。Frontier-Bench v0.1 是当前最直接映射企业开发团队实际工作的基准测试之一,让模型自己在终端里写代码、跑代码、调试多文件变更。Opus 5 拿到了 43.3%,Fable 5 是 33.7%。将近 10 个百分点的差距,在编程评测里属于碾压级别。Opus 4.8 在这个测试上是 21.1%,Opus 5 直接翻了一倍多。

在 CursorBench 3.2 上,Opus 5 在最高推理强度下达到 Fable 5 峰值成绩的 94.5%,单次任务成本只有一半。Anthropic 还宣称,在 high、xhigh 和 max 三个推理等级上,Opus 5 在同成本下的性能都超过了所有其他模型。Cognition(Devin 背后的公司)CEO Scott Wu 在 FrontierCode 1.1 评测后确认:“Claude Opus 5 在调试和根因分析方面以一半成本达到了接近 Fable 级别的性能。”

在自主搜索(Agentic Search)上,Opus 5 拿到 90.8%,Fable 5 是 87.4%。十次搜索有九次以上能独立搞定。计算机使用(OSWorld 2.0)上,Opus 5 在约三分之一成本下就超过了 Fable 5 的最优成绩。企业业务流程自动化(Business Workflows)方面,Opus 5 拿到 26%,Fable 5 只有 17.4%。

科学领域同样不弱。Opus 5 在有机化学任务上比 Opus 4.8 高出 10.2 个百分点(包括从光谱数据推断分子结构),在蛋白质相关任务上高出 7.7 个百分点(包括预测序列变异对功能的影响)。在号称“人类最后考试”的 Humanity's Last Exam 上,开启工具后 Opus 5 拿到 64.7%,Fable 5 是 63.9%(不开工具时分别为 56.3% 和 56.5%),差距不到一个百分点。

但真正让整个 AI 研究圈停下滚动的,是 ARC-AGI 3 的成绩。

ARC-AGI 3 是 François Chollet 设计来衡量“流体智能”的基准。它不是让模型回忆训练数据里见过的东西,而是把它扔进完全陌生的交互式环境里,没有指令、没有规则说明、没有目标提示,靠试错自己摸索。人类能完成 100% 的任务。今年 3 月 ARC Prize Foundation 发布这个基准时,最强 AI 模型的得分是 0.37%(Gemini 3.1 Pro)。到 Opus 5 发布前,公开最强成绩是 GPT-5.6 Sol 在最大推理强度下的 7.8%。Opus 4.8 只有 1.5%。

Opus 5 拿到了 30.2%。是 GPT-5.6 Sol 的近四倍,Opus 4.8 的二十倍。


这个数字的意义远超任何编程或搜索基准。ARC-AGI 3 奖励的不是“做过类似的事所以能做”,而是“从没训练过也能做”。30.2% 意味着 Opus 5 确实在通过交互来推导陌生的规则体系,而不只是模式匹配。Vellum AI 的基准分析文章直言:“这个数字让所有人都停下了滚动。”

2

它不只是分数高

基准数字告诉我们 Opus 5 考了多少分。但 Anthropic 公布的案例告诉了我们是它怎么考到这些分的。

Anthropic 公布了一个 3D 建模任务,只给模型一张机械零件的设计图纸,要求它自主编写代码重建完整的 FreeCAD 3D 模型。在 Opus 5 之前,没有任何模型能完成这个任务,即使人工提前搭好开发框架、给出详细方案,模型依然会出错。Opus 5 不仅完成了全过程自主闭环,还自己搭建了配套的测试工具,逐一校验代码的数据解析逻辑,反复核查修正问题,直到通过验证。

在没有任何人工干预的情况下,自主完成了一个完整的工程验证循环,设定目标、规划步骤、编写代码、测试输出、发现错误、回溯修正、再次测试、通过。

Zapier CEO Wade Foster 透露,团队用 Opus 5 处理客户健康度原始表格,要求 AI 独立完成全套客户流失预防流程,包括标记高风险账户、通知对应负责人、整理运营报告。“以前的模型没有能完整跑通这条流程的,”Foster 说,“Opus 5 做到了 100% 完整交付。”

Box CTO Ben Kus 给出了量化对比:Opus 5 在专业企业内容处理上整体比 Opus 4.8 提升 8%,数据分析工作流提升 11%,尽职调查提升 17%。一家金融建模团队的评估负责人 Richard Pham 测出了准确率高 9 个百分点,同时周转次数少三分之一、耗时少 60%。法律 AI 团队 Applied Research 负责人 Niko Grupen 发现 Opus 5 在保持质量的同时,平均比 Opus 4.8 在最高推理强度下少生成了 26% 的 token。

更少的 token、更少的交互轮次、更少的人盯着屏幕。这就是 Opus 5 对“性价比”的真正定义。

3

没人预料到的 30.2%

回到 ARC-AGI 3。这个数字的冲击力需要放在时间线上理解。

今年 3 月,Gemini 3.1 Pro 以 0.37% 领先。到 Opus 5 发布前,公开最强成绩是 GPT-5.6 Sol 在最大推理强度下的 7.8%。Opus 4.8 挂在 1.5%。Opus 5 发布当天直接拉到 30.2%。Anthropic 在公告中说 Opus 5 的成绩是“次优模型的三倍”,这个表述甚至可能是保守的,因为 GPT-5.6 Sol 的 7.8% 是在最大推理强度设置的极端资源消耗下拿到的,而 Opus 5 在标准推理设置下就做到了 30.2%。

ARC-AGI 3 它测的是遇到完全没见过的问题时的应变能力,Chollet 设计的逻辑是,把模型扔进一个没有任何参考框架的新世界,看它能不能靠自己理解规则、制定策略、达成目标。这才是“通用智能”的真正含义。不是知识面有多广,而是面对未知时的适应速度有多快。

30.2% 意味着 Opus 5 在三分之一的情况下能独立完成人类能完成的任务,而这些任务是它绝对没有在训练数据里遇到过同类题型的。AI从“超强模式匹配器”向“自主推理系统”的转变,正在被量化验证,而不是停留在口号层面。

但更值得追问的是,为什么 Anthropic 要发布一款在核心指标上碾压自家“旗舰”的模型,还只卖一半的价格?

这需要看一圈 Opus 5 周围的定价坐标。


再回头看看 Fable 5 的 $10/$50。这个定价在 2026 年 7 月的市场上像一座孤岛,周围的海平面每天都在上涨。Fable 5 在 6 月 9 日发布时,它的“神话级”(Mythos-class)性能确实值这个溢价。但仅仅 45 天后,Opus 5 就用不到一半的价格,在用户最关心的场景里拿出了更好的成绩。

Anthropic 面临的困境是,Fable 5 的定价正在被市场抛弃,而竞争对手,尤其是 Kimi K3 的开源攻势,正在从下方蚕食。继续守着 Fable 5 的高价策略,等于把高频使用场景(编程、搜索、办公自动化)的客户拱手让人。Anthropic 的选择是,与其等竞争对手来拆,不如自己先拆。用 Opus 5 把旗舰级能力注入中端产品线,在性价比战场正面迎战,同时让 Fable 5 继续守住“极致推理”的利基市场。

Opus 5 的商业使命可以概括为一句话,证明 Anthropic 还能收前沿溢价。而 Anthropic 给出的回答是,不收了。或者说,前沿溢价的门槛被自己抬高了。你得先在 $5/$25 这个价格点上拿出比 Fable 5 更强的编程和推理能力,才有资格谈“溢价”。

4

大模型定价的逻辑

已经不太一样了

Opus 5 的发布,本质上宣告了大模型行业“越贵越强”定价范式的终结。

过去两年,行业默认的逻辑是,更强的模型需要更大的参数、更多的训练算力、更高的推理成本,所以必然更贵。Fable 5 的 $10/$50 定价就是这条逻辑链的终极产物。我比任何人都强,所以我可以收最贵的钱。但 Opus 5 用数据证明了一件事,更强的推理架构和更高效的训练方法,可以让模型在价格不变甚至更低的情况下,性能跳升一个量级。

Opus 5 的定价和 Opus 4.8 完全相同($5/$25),但 Frontier-Bench 得分从 21.1% 跳到了 43.3%,ARC-AGI 3 从 1.5% 跳到了 30.2%。同样的价格,推理能力提升了一个量级。这不是边际改善,是范式跃迁。

“旗舰”这个词本身的含义正在被重新定义。当一款 $5/$25 的模型能在你每天实际使用的场景里跑赢 $10/$50 的模型,“旗舰”就从一个能力标签变成了一个价格标签,而价格标签是最容易被竞争对手撕掉的。

这给整个行业传递了一个清晰的信号:如果你今天的旗舰模型不能在效率上持续拉开代差,明天就会有一个价格只有你一半的模型在功能上超越你。Anthropic 今天自己动手拆掉了自己的价格金字塔,意味着它已经预判到了这个趋势不可逆转,选择主动引领而不是被动防守。

对于企业用户来说,Opus 5 是 2026 年迄今为止最值得认真评估的 AI 投入。在编程辅助(尤其是 Claude Code 和 Cursor 等 IDE 场景)、自动化办公(Zapier 等平台)、数据分析、科学研究等高频使用场景中,$5/$25 的定价结合超越 Fable 5 的性能,构成了当前市场上最清晰的性价比锚点。

但真正的变量在 7 月 27 日,Kimi K3 开源全部权重。当一个 2.8T 参数的模型可以免费部署、自由修改,且性能已经逼近前沿,整个行业的定价地板将再次被击穿。Opus 5 证明了“可以更便宜地做得更好”,而 Kimi K3 即将证明“可以几乎免费地做得差不多”。两条线同时推进,留给任何一家 AI 公司维持高溢价的窗口期,正在以天为单位收窄。

当一家公司开始用中端型号的价格卖旗舰级别的性能,这表明与其等对手来拆你的定价,不如自己先把牌桌掀了。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
BABYMONSTER雅贤胸部快掉出来!平口边跳边下滑 网心疼:她才19岁

BABYMONSTER雅贤胸部快掉出来!平口边跳边下滑 网心疼:她才19岁

ETtoday星光云
2026-07-29 13:19:08
日本“新特务头子”即将就任,是他

日本“新特务头子”即将就任,是他

补壹刀
2026-07-29 19:43:32
修杰楷认罪供出同伙求减刑,贾静雯含泪扛债,两女目睹吓哭惨崩溃

修杰楷认罪供出同伙求减刑,贾静雯含泪扛债,两女目睹吓哭惨崩溃

橙星文娱
2026-07-30 07:59:04
智驾“小蓝灯”将被禁用

智驾“小蓝灯”将被禁用

第一财经资讯
2026-07-29 15:08:34
天价退票费,全额退还了!

天价退票费,全额退还了!

极目新闻
2026-07-30 00:57:53
彻底杀疯!伊朗突破百年战争底线,追杀特朗普全家,美国彻底没辙

彻底杀疯!伊朗突破百年战争底线,追杀特朗普全家,美国彻底没辙

郭长包工头
2026-07-30 01:58:57
回望几千年历史,为什么统治阶级总是对外撒钱,对内狠辣!

回望几千年历史,为什么统治阶级总是对外撒钱,对内狠辣!

花仙历史说
2026-07-30 07:42:34
李峰任上海市青浦区代理区长

李峰任上海市青浦区代理区长

澎湃新闻
2026-07-29 21:28:28
刘翔独特的烦恼:去年耐克千万代言费还没花完,今年就又到账了

刘翔独特的烦恼:去年耐克千万代言费还没花完,今年就又到账了

讯崽侃天下
2026-07-30 11:16:13
北大化学才女李天乐,潜伏在顶级药企工作十年,她利用职务之便领取铊,将清华丈夫一点点“熬”死在病房

北大化学才女李天乐,潜伏在顶级药企工作十年,她利用职务之便领取铊,将清华丈夫一点点“熬”死在病房

人生录
2026-07-30 00:05:08
FIFA官宣处分阿根廷3将!2人涉嫌实施暴力 西班牙21岁新星也被指控

FIFA官宣处分阿根廷3将!2人涉嫌实施暴力 西班牙21岁新星也被指控

我爱英超
2026-07-30 01:12:41
今年的养老金上涨,创了历史之最

今年的养老金上涨,创了历史之最

华人星光
2026-07-30 12:24:57
派出所最怕的三个投诉,一个比一个狠,这样做最管用!

派出所最怕的三个投诉,一个比一个狠,这样做最管用!

细说职场
2026-07-29 14:27:12
全球仅 20 例!
​巴西一女子在同一晚与 2 名男子发生了关系

全球仅 20 例! ​巴西一女子在同一晚与 2 名男子发生了关系

岁月有情1314
2026-07-29 12:01:27
网传中国有博导是这个鸟样,难怪那么多人去国外读博…

网传中国有博导是这个鸟样,难怪那么多人去国外读博…

慧翔百科
2026-07-30 08:34:48
祖辈种的百年古树被警方扣押后遭林业局赠送?村民申诉多年,高院已裁定驳回再审申请丨云投诉

祖辈种的百年古树被警方扣押后遭林业局赠送?村民申诉多年,高院已裁定驳回再审申请丨云投诉

封面新闻
2026-07-29 20:39:15
赛里木湖自驾每人收75元引争议,景区称相关费用已做备案

赛里木湖自驾每人收75元引争议,景区称相关费用已做备案

界面新闻
2026-07-30 10:06:07
伊朗:乌克兰军方这一袭击是在以色列授意下进行的,目的是将欧洲拖入战争,相关损失必须得到赔偿,乌克兰:从未蓄意打击民用船只及人员

伊朗:乌克兰军方这一袭击是在以色列授意下进行的,目的是将欧洲拖入战争,相关损失必须得到赔偿,乌克兰:从未蓄意打击民用船只及人员

政知新媒体
2026-07-29 13:27:51
为什么只有美国办世界杯能赚钱?看完23届账本我悟了

为什么只有美国办世界杯能赚钱?看完23届账本我悟了

乒乓球教学
2026-07-29 22:16:22
近844克黄金被扣押36年:男子申请返还被驳回,烟台中院组织质证

近844克黄金被扣押36年:男子申请返还被驳回,烟台中院组织质证

澎湃新闻
2026-07-30 11:22:28
2026-07-30 14:52:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4263409文章数 9086关注度
往期回顾 全部

科技要闻

为什么国产替代越深入,反而越难赚钱?

头条要闻

独居老太起床被吓瘫软:阳台上满地"血迹" 还摆一羊头

头条要闻

独居老太起床被吓瘫软:阳台上满地"血迹" 还摆一羊头

体育要闻

毫无存在感的NBA状元,最先谢谢惠顾?

娱乐要闻

周星驰用态度打破快餐式宣发

财经要闻

中共中央政治局:提升资本市场韧性和信心

汽车要闻

营收下滑但盈利修复 保时捷上半年财报释放了哪些信号?

态度原创

亲子
本地
旅游
数码
公开课

亲子要闻

别再乱涂儿童防晒!(最后一只千万要避雷)

本地新闻

中国少年手球队共建揭牌暨中匈女手巅峰赛

旅游要闻

西安一景点猫石像被游客摸到发亮,景区回应“石像历史悠久”传闻:后来修的

数码要闻

爱适易和贝克巴斯哪个好?3个算账真相 买错亏大了

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版