网易首页 > 网易号 > 正文 申请入驻

刚刚,Claude Opus 5 发布,半价追平 Fable 5

0
分享至

昨晚,科技圈刚上演了一场开源 AI 大团建。

英伟达创始人黄仁勋在社交媒体发表公开信,拉上 Meta、微软等科技巨头/机构,为开源模型鼓劲打气。但眼尖的网友很快发现,Anthropic、OpenAI 和 Google 都没有签字。


几家公司的缺席,很容易被外界解读为 AI 阵营之间的又一次分野。而就在刚刚,Anthropic 也正式发布了新的闭源模型 Claude Opus 5,也让这种矛盾摆在明面上。

它没有讲太多宏大叙事,卖点相当务实:性能逼近 Fable 5,价格却只有后者的一半,颇有几分丐版的价格,享受准顶配服务的意思。


在 Frontier-Bench、GDPval-AA 等编程和知识工作评测中,Opus 5 已经登上榜首。少数没有拿下的项目集中在网络安全领域,目前仍落后于能力更强的 Mythos 5。

比起单纯谈论 Opus 5 的纸面参数,在官方宣传之外,它到底强在哪、以及「半价旗舰」有没有隐藏代价,才是我们更值得关注的部分。


Fable 5 的性能,Opus 4.8 的价格

Anthropic 此次重点强调了一个概念:effort,也就是思考档位。

用户可以自行调节。需要更强的推理能力,就把档位调高;更在意速度、价格和 token 消耗,就降低档位。官方公布的大部分成绩,都是在不同 effort 设置下测出来的。

软件工程是 Opus 5 表现最突出的领域。

在 Anthropic 内部的 Frontier-Bench v0.1 测试中,Opus 5 超过了所有参测模型。性能相比 Opus 4.8 提升一倍以上,完成单项任务的成本反而更低。


CursorBench 3.2 上,开启 max effort 后,Opus 5 与旗舰 Fable 5 的最高分只差 0.5%,成本却只有后者的一半。


在 high、xhigh 和 max 几个高档位中,同样的预算下,Opus 5 得分也超过了所有其他模型。大致可以理解为,花一半的钱,完成接近 99% 的工作。

知识工作和复杂解题上,Opus 5 延续了类似表现。

ARC-AGI 3 主要测试模型处理陌生问题的能力。面对训练中没有见过的新任务,Opus 5 的得分达到第二名的三倍。


Zapier AutomationBench 考察模型能否从头到尾完成一项商业任务。Opus 5 的任务通过率,大约是同等成本下第二名的 1.5 倍。即使只开启最低 effort 档位,它完成的任务数量也超过所有其他模型。

在 OSWorld 2.0 电脑操作测试中,Opus 5 用略高于三分之一的成本,就超过了 Fable 5 的最好成绩。


GDPval-AA v2、HLE 和 DeepSearchQA 等评测里,它也成了 Anthropic 模型中兼顾性能和成本的最佳选择。

科学研究能力同样有所提升。

在生命科学的每一项评测中,Opus 5 都超过了 Opus 4.8,覆盖结构生物学、有机化学、生物信息学等方向。

提升幅度最大的是有机化学。例如,根据光谱数据推断分子结构,Opus 5 比 Opus 4.8 高出 10.2 个百分点;预测蛋白质序列变异对功能的影响,高出 7.7 个百分点。

不过,官方跑分表里也出现了一个小插曲。

在最初发布的对比图中,FrontierCode v1.1 一栏将 Opus 5 的 53.4% 加粗标记为最高分,而旁边另一款模型的成绩明明是 53.5%。被网友抓包后,目前官网已经更换了图片,将标记恢复正常。


类似场面并不陌生。OpenAI 此前也曾在图表制作上出错,纵轴比例与实际数据不一致,导致柱状图呈现出误导性的视觉效果。


只能说,「世界是个巨大的草台班子」这句话的含金量还在继续上升。换个角度看,或许从制图者制图的那一刻开始,就已经带有先入为主的心态。

当 AI 模型开始主动验证自己

Anthropic 反复强调 Opus 5 的一种能力:遇到复杂任务时,它会主动验证自己的结果。一次没有成功,就重新检查、调整方案,再次尝试,直到任务完成。

官方测试给出了几个代表性案例。

面对机械零件图纸,Opus 5 在没有视觉工具的情况下,自行编写算法并完成 3D 重建;修复开源项目 bug 时,它找到了社区补丁遗漏的边界问题;搭建交易所行情接口时,它还自己生成模拟数据验证代码。

模型开放之后,社区也照例先玩了一圈。


沃顿商学院教授 Ethan Mollick 提前获得了使用权限。他的评价相对克制:短任务中,Opus 5 可以追平甚至超过 Fable 级模型;面对长时间、复杂度更高的任务时,它显得少了一点「雄心」,最终交付的完整度仍有差距。

尽管如此,他还是用 Opus 5 替换了此前长期使用的 Opus 4.8,因为新模型在整体能力上明显更强。

唯一让他不太满意的是,Opus 5 继承了 Fable 的部分语言习惯,比如对高密度表达的异常偏好,以及一股很明显的「Fable 味」。


比如他让 Opus 5 制作了一个哥特风格着色器,还生成了一款可以在山寨中土世界修建铁路的游戏。


还有网友 Chetaslua 用它制作了一套阿波罗登月模拟,全部内容由程序生成。


Harshith 留下一句「Opus 5 max 简直逆天」的评价,随后展示了一架带有帝国风格双离子引擎的星际战斗机。


再比如网友 Charlie Hills 转发的官方案例:用 Opus 5 搭建出了一套可以实际运行的风洞模拟系统,能够将空气流过物体表面的过程进行可视化。


更安全,也同样会回退到 Opus 4.8

技术能力之外,Anthropic 此次也花了大量篇幅讨论安全问题。

自动化行为审计结果显示,Opus 5 是 Anthropic 目前行为最符合预期的模型。

与 Opus 4.8、Sonnet 5 和 Fable 5 相比,它对 Claude 行为准则的遵循程度更高,欺骗行为更少,也更难被诱导执行危险操作。


面对可能造成不可逆后果的任务时,它也更倾向于先检查风险,再采取行动。

Opus 5 的整体失准行为得分为 2.3,是 Anthropic 近期模型中的最低值。在生物研究和攻击性网络安全任务中,它依然落后于能力更强的 Mythos 5。

网络安全部分尤其值得关注。

Anthropic 表示,与 Opus 4.8 一样,没有专门使用网络攻击任务训练 Opus 5。但随着模型综合能力提升,它发现漏洞的水平已经逐渐逼近 Mythos 5。发现漏洞与将漏洞转化为真实攻击工具,仍然存在明显差距。


简言之,Opus 5 已经能够判断一把锁存在什么问题,但距离真正撬开它还有很远。

Anthropic 使用 OSS-Fuzz 评测展示了这种差异。在漏洞发现任务中,Opus 5 与 Mythos 5 接近;到了编写漏洞利用代码的阶段,成绩便明显落后。

基于这一风险边界,Opus 5 会对网络安全请求进行额外审核。一旦请求涉及高风险攻击行为并触发安全限制,系统会将任务回退到 Opus 4.8 处理。

没错,又是 Opus 4.8。


今天起,Opus 5 已在所有平台同步上线。API 模型名称为 claude-opus-5。价格方面,每百万输入 token 为 5 美元,每百万输出 token 为 25 美元,与 Opus 4.8 完全相同。


https://platform.claude.com/docs/en/about-claude/pricing

需要更快响应速度的用户还可以开启 Fast 模式,推理速度约为默认模式的 2.5 倍,价格则提高至两倍。

在 Claude Platform 上,Fast 模式按照基础价格的两倍计费;在 Claude Code 中,则通过使用额度进行抵扣。计费规则与 Opus 4.8 时期保持一致。

伴随模型发布的,还有两个仍处于 beta 阶段的更新。

第一项更新面向 Claude Platform。开发者可以在对话进行过程中,动态修改 Claude 能够使用的工具,同时不会导致 prompt 缓存失效。

第二项更新是 API 自动回落机制。

开发者可以选择将被安全分类器拦截的请求,自动转交给其他模型处理。开启后,请求默认会交给当前可用的最强模型,数据保留方面,Opus 5 延续了以往 Opus 系列的规则,普通访问没有强制数据保留要求。

聪明反被「规矩」误

此次发布中,还有一个颇为反直觉的经验,来自 Anthropic 工程师 Thariq Shihipar。

团队发现,为 Claude 5 系列编写指令时,可以大幅减少系统提示词。Claude Code 的系统提示词被删除了 80% 以上,编程评测成绩却没有出现可测量的下降。

Thariq 随后总结了几条过去被广泛采用、如今可能已经过时的提示词规则。


https://x.com/trq212/status/2080710971228918066

过去强调给 Claude 制定详细规则,如今更倾向于让 Claude 根据上下文自行判断。例如,旧版系统提示词会明确规定「默认不要编写注释」。面对复杂代码时,这条规则很容易产生问题。

新版本只保留一句要求:生成的代码应当融入周围代码,注释密度、命名方式和整体风格都参考现有项目。

过去强调提供示例,如今更重视接口设计。

Anthropic 发现,示例有时会限制模型的探索范围。相比之下,将工具参数设计得更能准确表达意图,效果反而更好。

过去习惯一次性提供全部信息,如今更提倡按需加载,也就是 progressive disclosure。暂时用不到的代码审查和验证流程,会被放进独立 skill 中,需要时再调用。


过去倾向于反复强调关键要求,如今只要工具说明足够清楚,写一次通常已经足够,没有必要在系统提示词中重复。模型能力提高后,许多原本用于限制错误行为的繁复规则,逐渐变成了新的约束。

Anthropic 还为此推出了一个名为 claude doctor 的命令。用户在 Claude Code 中输入 /doctor,系统便会自动检查过度臃肿的 skill 和 CLAUDE.md 文件,并给出精简建议。

从事无巨细地教模型做事,到逐渐将判断权交给模型,或许才是 Opus 5 此次发布中最值得留意的变化。而当模型越来越聪明,人类写下的那些「经验」,反倒可能成为它首先需要摆脱的包袱。

附上参考地址:

https://www.anthropic.com/news/claude-opus-5

https://support.claude.com/en/articles/16049681-why-claude-switched-models-in-your-conversation-with-opus-5

https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models

我们正在招募伙伴

简历投递邮箱hr@ifanr.com

✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
互交白卷,伊朗男足亚运队主帅:很难攻破中国队的防守体系

互交白卷,伊朗男足亚运队主帅:很难攻破中国队的防守体系

懂球帝
2026-09-21 09:28:04
76人媒体发问:詹姆斯连续23年20+,新赛季能持续吗?两点会成关键

76人媒体发问:詹姆斯连续23年20+,新赛季能持续吗?两点会成关键

鱼崖大话篮球
2026-09-21 11:10:46
年度剧王,终于来了,刚上线就飚出9.3!

年度剧王,终于来了,刚上线就飚出9.3!

陈意小可爱
2026-09-21 01:32:11
舆论反转!“我怎么知道你没穿衣服”,长沙快递员上门取件,裸身女子被看光,网友:支持快递员反诉

舆论反转!“我怎么知道你没穿衣服”,长沙快递员上门取件,裸身女子被看光,网友:支持快递员反诉

火山詩话
2026-09-20 18:05:19
再也瞒不下去了!德国专家曾指出,中美之所以尚未爆发冲突,不是因为美国没本事,而是美国可能已经察觉到了形势的严峻

再也瞒不下去了!德国专家曾指出,中美之所以尚未爆发冲突,不是因为美国没本事,而是美国可能已经察觉到了形势的严峻

z千年历史老号
2026-09-14 17:23:40
社保缴费22年7个月,个人账户8.24万,湖北武汉退休,没有视同缴费年限能拿多少钱?

社保缴费22年7个月,个人账户8.24万,湖北武汉退休,没有视同缴费年限能拿多少钱?

平静话社保
2026-09-21 09:02:44
交个朋友直播间售问题 “溜溜凳”:内部用发霉木板、废旧海绵,回应称已全面下架

交个朋友直播间售问题 “溜溜凳”:内部用发霉木板、废旧海绵,回应称已全面下架

蓝鲸新闻
2026-09-20 14:16:50
2028美国大选将变天?川普接班人不是万斯,而是被中国制裁的他?

2028美国大选将变天?川普接班人不是万斯,而是被中国制裁的他?

璀璨幻行者
2026-09-20 23:22:52
有人预测:若无意外,10月份后中国或迎来4大降价潮,应早做准备

有人预测:若无意外,10月份后中国或迎来4大降价潮,应早做准备

说故事的阿袭
2026-09-21 10:25:30
“患癌就老实了!”低认知宝妈带娃在地下车库吃饭写作业,网友:打扮的还挺漂亮!

“患癌就老实了!”低认知宝妈带娃在地下车库吃饭写作业,网友:打扮的还挺漂亮!

林林先生
2026-09-15 10:24:09
中阿大战刷净胜球!毛伟杰回左路更凶,徐彬替补吧,老蒯+依木兰不上浪费了

中阿大战刷净胜球!毛伟杰回左路更凶,徐彬替补吧,老蒯+依木兰不上浪费了

刀锋体育
2026-09-21 08:15:57
农妇被扒光游街、私刑、弑母:1990年震动中央的湖南特大宗族案

农妇被扒光游街、私刑、弑母:1990年震动中央的湖南特大宗族案

阿胡
2026-09-16 11:28:34
9岁儿子刷公司卡投11.8万广告,父亲被解雇还要30天还清

9岁儿子刷公司卡投11.8万广告,父亲被解雇还要30天还清

峡谷一级保护废物
2026-09-20 09:51:55
男篮输伊朗。赛后媒体:主教练失去了掌控。崔永熙:我不知说什么

男篮输伊朗。赛后媒体:主教练失去了掌控。崔永熙:我不知说什么

冷桂零落
2026-09-21 11:05:28
手机关掉这个开关,瞬间跟新机一样流畅

手机关掉这个开关,瞬间跟新机一样流畅

辉哥说动漫
2026-09-17 01:27:25
被骂尺度太大?池昌旭林珍娜的大胆出演,藏着最纯粹的演员初心

被骂尺度太大?池昌旭林珍娜的大胆出演,藏着最纯粹的演员初心

传递满满正能量
2026-09-19 06:08:21
连续三个赛季贡献20+进球与10+助攻,梅西成为美职联历史首人

连续三个赛季贡献20+进球与10+助攻,梅西成为美职联历史首人

懂球帝
2026-09-21 10:11:06
让郭士强下课?篮协出手了,名记:领导发话,让全体人员写总结

让郭士强下课?篮协出手了,名记:领导发话,让全体人员写总结

喜欢体育的猫
2026-09-21 09:41:36
这样打扮的成熟女人,还挺有魅力的

这样打扮的成熟女人,还挺有魅力的

美女穿搭分享
2026-09-13 10:22:54
住建部:支持个体工商户、非全日制从业人员以及其他灵活就业人员自愿缴存住房公积金

住建部:支持个体工商户、非全日制从业人员以及其他灵活就业人员自愿缴存住房公积金

每日经济新闻
2026-09-18 13:46:03
2026-09-21 12:04:49
AppSo incentive-icons
AppSo
让智能手机更好用的秘密
6839文章数 26911关注度
往期回顾 全部

科技要闻

智谱将上线“零数据留存”机制

头条要闻

菲律宾挑衅中国后 英国和加拿大突然激动结果"翻车"了

头条要闻

菲律宾挑衅中国后 英国和加拿大突然激动结果"翻车"了

体育要闻

游泳2小时6金!亚运金牌榜:中国11金领跑

娱乐要闻

76岁站上红馆开唱,谭咏麟说回馈歌迷

财经要闻

机器人IPO门槛收紧?能否商业闭环成考量

汽车要闻

7年70万辆 新红旗HS5焕新升级,这次变在哪?

态度原创

健康
教育
游戏
艺术
军事航空

有人倒地抽搐?!是癫痫还是中风?

教育要闻

多所985,研究生新生人数反超本科生!

成人级恋爱新游登Steam!双女主超润 大雷巨劲爆

艺术要闻

豪车布加迪盖楼,美国首个住宅效果图曝光,你会买吗?

军事要闻

莫斯科称遭"有史以来最大规模袭击"

无障碍浏览 进入关怀版