网易首页 > 网易号 > 正文 申请入驻

Opus 5 反超 Fable 5,Anthropic 的定价牌局被打乱了?

0
分享至


7月25日凌晨1点,Anthropic 发布了 Claude Opus 5。如果只看名字,你会以为它是 Opus 4.8 的继任者,Anthropic 产品线中比 Sonnet 强但比 Fable 弱的中间型号。

但一看数据就会发现,这款定价 $5/$25(每百万输入/输出 token)的模型,在编程、自主搜索、计算机使用、企业业务流程等多个关键基准测试上,把定价 $10/$50 的 Fable 5 给超了。而它的成本,只有 Fable 5 的一半。

Anthropic 在官方公告里表示:“Opus 5 comes close to the frontier intelligence of Claude Fable 5 at half the price”,意思是接近 Fable 5 的智能,价格减半。但他们自己发布的基准测试图表显示,Opus 5 在至少四项核心评测中明确领先 Fable 5,而且是在更低的成本下做到的。

被“次旗舰”反超的“旗舰”

先看编程能力。Frontier-Bench v0.1 是当前最直接映射企业开发团队实际工作的基准测试之一,让模型自己在终端里写代码、跑代码、调试多文件变更。Opus 5 拿到了 43.3%,Fable 5 是 33.7%。将近 10 个百分点的差距,在编程评测里属于碾压级别。Opus 4.8 在这个测试上是 21.1%,Opus 5 直接翻了一倍多。

在 CursorBench 3.2 上,Opus 5 在最高推理强度下达到 Fable 5 峰值成绩的 94.5%,单次任务成本只有一半。Anthropic 还宣称,在 high、xhigh 和 max 三个推理等级上,Opus 5 在同成本下的性能都超过了所有其他模型。Cognition(Devin 背后的公司)CEO Scott Wu 在 FrontierCode 1.1 评测后确认:“Claude Opus 5 在调试和根因分析方面以一半成本达到了接近 Fable 级别的性能。”

在自主搜索(Agentic Search)上,Opus 5 拿到 90.8%,Fable 5 是 87.4%。十次搜索有九次以上能独立搞定。计算机使用(OSWorld 2.0)上,Opus 5 在约三分之一成本下就超过了 Fable 5 的最优成绩。企业业务流程自动化(Business Workflows)方面,Opus 5 拿到 26%,Fable 5 只有 17.4%。

科学领域同样不弱。Opus 5 在有机化学任务上比 Opus 4.8 高出 10.2 个百分点(包括从光谱数据推断分子结构),在蛋白质相关任务上高出 7.7 个百分点(包括预测序列变异对功能的影响)。在号称“人类最后考试”的 Humanity's Last Exam 上,开启工具后 Opus 5 拿到 64.7%,Fable 5 是 63.9%(不开工具时分别为 56.3% 和 56.5%),差距不到一个百分点。

但真正让整个 AI 研究圈停下滚动的,是 ARC-AGI 3 的成绩。

ARC-AGI 3 是 François Chollet 设计来衡量“流体智能”的基准。它不是让模型回忆训练数据里见过的东西,而是把它扔进完全陌生的交互式环境里,没有指令、没有规则说明、没有目标提示,靠试错自己摸索。人类能完成 100% 的任务。今年 3 月 ARC Prize Foundation 发布这个基准时,最强 AI 模型的得分是 0.37%(Gemini 3.1 Pro)。到 Opus 5 发布前,公开最强成绩是 GPT-5.6 Sol 在最大推理强度下的 7.8%。Opus 4.8 只有 1.5%。

Opus 5 拿到了 30.2%。是 GPT-5.6 Sol 的近四倍,Opus 4.8 的二十倍。


这个数字的意义远超任何编程或搜索基准。ARC-AGI 3 奖励的不是“做过类似的事所以能做”,而是“从没训练过也能做”。30.2% 意味着 Opus 5 确实在通过交互来推导陌生的规则体系,而不只是模式匹配。Vellum AI 的基准分析文章直言:“这个数字让所有人都停下了滚动。”

它不只是分数高

基准数字告诉我们 Opus 5 考了多少分。但 Anthropic 公布的案例告诉了我们是它怎么考到这些分的。

Anthropic 公布了一个 3D 建模任务,只给模型一张机械零件的设计图纸,要求它自主编写代码重建完整的 FreeCAD 3D 模型。在 Opus 5 之前,没有任何模型能完成这个任务,即使人工提前搭好开发框架、给出详细方案,模型依然会出错。Opus 5 不仅完成了全过程自主闭环,还自己搭建了配套的测试工具,逐一校验代码的数据解析逻辑,反复核查修正问题,直到通过验证。

在没有任何人工干预的情况下,自主完成了一个完整的工程验证循环,设定目标、规划步骤、编写代码、测试输出、发现错误、回溯修正、再次测试、通过。

Zapier CEO Wade Foster 透露,团队用 Opus 5 处理客户健康度原始表格,要求 AI 独立完成全套客户流失预防流程,包括标记高风险账户、通知对应负责人、整理运营报告。“以前的模型没有能完整跑通这条流程的,”Foster 说,“Opus 5 做到了 100% 完整交付。”

Box CTO Ben Kus 给出了量化对比:Opus 5 在专业企业内容处理上整体比 Opus 4.8 提升 8%,数据分析工作流提升 11%,尽职调查提升 17%。一家金融建模团队的评估负责人 Richard Pham 测出了准确率高 9 个百分点,同时周转次数少三分之一、耗时少 60%。法律 AI 团队 Applied Research 负责人 Niko Grupen 发现 Opus 5 在保持质量的同时,平均比 Opus 4.8 在最高推理强度下少生成了 26% 的 token。

更少的 token、更少的交互轮次、更少的人盯着屏幕。这就是 Opus 5 对“性价比”的真正定义。

没人预料到的 30.2%

回到 ARC-AGI 3。这个数字的冲击力需要放在时间线上理解。

今年 3 月,Gemini 3.1 Pro 以 0.37% 领先。到 Opus 5 发布前,公开最强成绩是 GPT-5.6 Sol 在最大推理强度下的 7.8%。Opus 4.8 挂在 1.5%。Opus 5 发布当天直接拉到 30.2%。Anthropic 在公告中说 Opus 5 的成绩是“次优模型的三倍”,这个表述甚至可能是保守的,因为 GPT-5.6 Sol 的 7.8% 是在最大推理强度设置的极端资源消耗下拿到的,而 Opus 5 在标准推理设置下就做到了 30.2%。

ARC-AGI 3 它测的是遇到完全没见过的问题时的应变能力,Chollet 设计的逻辑是,把模型扔进一个没有任何参考框架的新世界,看它能不能靠自己理解规则、制定策略、达成目标。这才是“通用智能”的真正含义。不是知识面有多广,而是面对未知时的适应速度有多快。

30.2% 意味着 Opus 5 在三分之一的情况下能独立完成人类能完成的任务,而这些任务是它绝对没有在训练数据里遇到过同类题型的。AI 从“超强模式匹配器”向“自主推理系统”的转变,正在被量化验证,而不是停留在口号层面。

但更值得追问的是,为什么 Anthropic 要发布一款在核心指标上碾压自家“旗舰”的模型,还只卖一半的价格?

这需要看一圈 Opus 5 周围的定价坐标。


再回头看看 Fable 5 的 $10/$50。这个定价在 2026 年 7 月的市场上像一座孤岛,周围的海平面每天都在上涨。Fable 5 在 6 月 9 日发布时,它的“神话级”(Mythos-class)性能确实值这个溢价。但仅仅 45 天后,Opus 5 就用不到一半的价格,在用户最关心的场景里拿出了更好的成绩。

Anthropic 面临的困境是,Fable 5 的定价正在被市场抛弃,而竞争对手,尤其是 Kimi K3 的开源攻势,正在从下方蚕食。继续守着 Fable 5 的高价策略,等于把高频使用场景(编程、搜索、办公自动化)的客户拱手让人。Anthropic 的选择是,与其等竞争对手来拆,不如自己先拆。用 Opus 5 把旗舰级能力注入中端产品线,在性价比战场正面迎战,同时让 Fable 5 继续守住“极致推理”的利基市场。

Opus 5 的商业使命可以概括为一句话,证明 Anthropic 还能收前沿溢价。而 Anthropic 给出的回答是,不收了。或者说,前沿溢价的门槛被自己抬高了。你得先在 $5/$25 这个价格点上拿出比 Fable 5 更强的编程和推理能力,才有资格谈“溢价”。

大模型定价的逻辑,已经不太一样了

Opus 5 的发布,本质上宣告了大模型行业“越贵越强”定价范式的终结。

过去两年,行业默认的逻辑是,更强的模型需要更大的参数、更多的训练算力、更高的推理成本,所以必然更贵。Fable 5 的 $10/$50 定价就是这条逻辑链的终极产物。我比任何人都强,所以我可以收最贵的钱。但 Opus 5 用数据证明了一件事,更强的推理架构和更高效的训练方法,可以让模型在价格不变甚至更低的情况下,性能跳升一个量级。

Opus 5 的定价和 Opus 4.8 完全相同($5/$25),但 Frontier-Bench 得分从 21.1% 跳到了 43.3%,ARC-AGI 3 从 1.5% 跳到了 30.2%。同样的价格,推理能力提升了一个量级。这不是边际改善,是范式跃迁。

“旗舰”这个词本身的含义正在被重新定义。当一款 $5/$25 的模型能在你每天实际使用的场景里跑赢 $10/$50 的模型,“旗舰”就从一个能力标签变成了一个价格标签,而价格标签是最容易被竞争对手撕掉的。

这给整个行业传递了一个清晰的信号:如果你今天的旗舰模型不能在效率上持续拉开代差,明天就会有一个价格只有你一半的模型在功能上超越你。Anthropic 今天自己动手拆掉了自己的价格金字塔,意味着它已经预判到了这个趋势不可逆转,选择主动引领而不是被动防守。

对于企业用户来说,Opus 5 是 2026 年迄今为止最值得认真评估的 AI 投入。在编程辅助(尤其是 Claude Code 和 Cursor 等 IDE 场景)、自动化办公(Zapier 等平台)、数据分析、科学研究等高频使用场景中,$5/$25 的定价结合超越 Fable 5 的性能,构成了当前市场上最清晰的性价比锚点。

但真正的变量在 7 月 27 日,Kimi K3 开源全部权重。当一个 2.8T 参数的模型可以免费部署、自由修改,且性能已经逼近前沿,整个行业的定价地板将再次被击穿。Opus 5 证明了“可以更便宜地做得更好”,而 Kimi K3 即将证明“可以几乎免费地做得差不多”。两条线同时推进,留给任何一家 AI 公司维持高溢价的窗口期,正在以天为单位收窄。

当一家公司开始用中端型号的价格卖旗舰级别的性能,这表明与其等对手来拆你的定价,不如自己先把牌桌掀了。

(本文首发钛媒体APP,作者 | AGI-Signal,编辑 | 秦聪慧)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
永远不要可怜一个40岁生了二胎三胎,却“失业养不起家”的中年人

永远不要可怜一个40岁生了二胎三胎,却“失业养不起家”的中年人

舒山有鹿
2026-07-24 11:34:02
郑丽文遭打脸!刚放出话、没料到“内鬼”拆台,赖清德阴谋得逞?

郑丽文遭打脸!刚放出话、没料到“内鬼”拆台,赖清德阴谋得逞?

爱意随风起呀
2026-07-25 10:29:55
给老人的忠告:千万不要在儿孙面前,表现出以下3种行为

给老人的忠告:千万不要在儿孙面前,表现出以下3种行为

来去自如的小章
2026-07-25 16:24:10
养老金连涨三年!人社部定调各地接着提标,老人年纪越大拿得越多

养老金连涨三年!人社部定调各地接着提标,老人年纪越大拿得越多

易昂杨
2026-07-25 07:28:37
特朗普:正与伊朗谈判,不排除加大军事打击!黄金突破4050美元,国际油价下跌

特朗普:正与伊朗谈判,不排除加大军事打击!黄金突破4050美元,国际油价下跌

金融界
2026-07-25 15:12:43
宏远消息!新老总清理杜锋嫡系,易建联有望回归、朱芳雨深夜发声

宏远消息!新老总清理杜锋嫡系,易建联有望回归、朱芳雨深夜发声

十级搞笑选手
2026-07-25 17:54:46
60年代,冯巩在幼儿园的照片,人家这长相,小时候都不怕丢

60年代,冯巩在幼儿园的照片,人家这长相,小时候都不怕丢

喜文多见01
2026-05-10 07:00:29
“邪恶”水蜜桃,第一球!

“邪恶”水蜜桃,第一球!

最江阴
2026-07-25 20:13:58
有人预言:从下半年开始,社区食堂、预制菜,很可能迎来行业新一轮洗牌

有人预言:从下半年开始,社区食堂、预制菜,很可能迎来行业新一轮洗牌

小谈食刻美食
2026-07-16 08:19:00
错失詹姆斯之后,热火与勇士开启争夺战,角逐这名未来名人堂球星

错失詹姆斯之后,热火与勇士开启争夺战,角逐这名未来名人堂球星

夜白侃球
2026-07-25 14:41:47
为什么建议大家尽量使用现金支付?原因很现实,告诉你答案

为什么建议大家尽量使用现金支付?原因很现实,告诉你答案

悦心知足
2026-07-25 16:54:52
中央5台今晚19:30现场直播男篮吗?中国男篮VS喀麦隆在哪看

中央5台今晚19:30现场直播男篮吗?中国男篮VS喀麦隆在哪看

宝哥精彩赛事
2026-07-25 00:22:55
瞒正部级身份参加孙子喜宴,亲家请市委书记,结果省委常委全来了

瞒正部级身份参加孙子喜宴,亲家请市委书记,结果省委常委全来了

阿天爱旅行
2026-07-25 00:17:54
老了才明白:兄弟姐妹过了60岁,最好的相处方式,就这5句话

老了才明白:兄弟姐妹过了60岁,最好的相处方式,就这5句话

阿凯销售场
2026-07-25 00:14:48
为啥普通人很少遇到贵人?网友:玻璃心,想得多,自尊心强,又自卑

为啥普通人很少遇到贵人?网友:玻璃心,想得多,自尊心强,又自卑

解读热点事件
2026-07-17 11:59:04
山西洪洞发生一起黄土崩塌,致5人死亡

山西洪洞发生一起黄土崩塌,致5人死亡

界面新闻
2026-07-25 09:53:46
张雪峰曾说过,真正有远见的父母,不会把小学六年浪费在钢琴、机器人、舞蹈等兴趣班

张雪峰曾说过,真正有远见的父母,不会把小学六年浪费在钢琴、机器人、舞蹈等兴趣班

户外阿毽
2026-07-15 06:02:59
39岁男子患上糖尿病,天天吃茄子,3个月后复诊,医生:你干了啥

39岁男子患上糖尿病,天天吃茄子,3个月后复诊,医生:你干了啥

岐黄传人孙大夫
2026-07-24 15:40:03
深圳峰会已拍板,泽连斯基却傻眼了:凭啥普京能参加,我也要去!

深圳峰会已拍板,泽连斯基却傻眼了:凭啥普京能参加,我也要去!

标体
2026-07-25 05:27:11
重庆博士生被逼到想鱼死网破,导师却放狠话:你在我面前如同蝼蚁

重庆博士生被逼到想鱼死网破,导师却放狠话:你在我面前如同蝼蚁

行者聊官
2026-07-23 10:21:35
2026-07-25 20:36:49
钛媒体APP incentive-icons
钛媒体APP
独立财经科技媒体
137163文章数 862476关注度
往期回顾 全部

科技要闻

星舰13飞全中!20颗真卫星出舱

头条要闻

SK掌门人离婚前妻分43.7亿 男方登报承认与他人婚外情

头条要闻

SK掌门人离婚前妻分43.7亿 男方登报承认与他人婚外情

体育要闻

拿过两个金球奖,却说它只值10英镑

娱乐要闻

王祖贤这么缺钱吗 竟然把自己卖给了AI

财经要闻

滥用市场支配地位 携程被罚没51.79亿元

汽车要闻

精致硬汉 吉利银河战舰700是台不一样的方盒子SUV

态度原创

教育
房产
数码
旅游
时尚

教育要闻

没矿的家庭,请不择手段培养这六项底层能力

房产要闻

37人抢1套房…海棠湾资产拍卖,爆了!

数码要闻

鸿蒙智行问界M9 Ultimate先行者配置新增3套内外饰组合

旅游要闻

郑州·登封——五岳名山庙宇中最大千年古柏群丨树说中原第六期

夏末的裹身裙,美出新高度!

无障碍浏览 进入关怀版