来源:市场资讯
(来源:硬核看板 浪潮工作室)
昨天晚上,Anthropic正式发布了Claude Opus 5。
官方没有把它说成“公司最强模型”,而是用了一个更务实的定位:这是一款更周到、更主动的模型,在不少任务上接近 Fable 5 的前沿能力,价格却只有后者的一半。
![]()
现在,Opus 5已经进入了Claude的全部付费套餐和API,成为Claude Max的默认模型,也是Claude Pro目前能用到的最强模型。
Opus 5到底有多强?又有多便宜?它适合干什么?又适合谁?这篇文章帮你解答。
![]()
编程和工具使用:
更强,但不是全胜
Anthropic在X上的第一张总表,配文是:“在多项编程和知识工作评测中,Opus 5达到了新的最佳水平。”
![]()
这份总表里最明显的变化来自终端编程,Opus 5 得到 43.3%,上一代只有 21.1%。知识工作使用另一套计分办法,Opus 5 得到 1861;联网搜索为 90.8%,电脑操作为 70.6%,业务流程为 26.0%。这些测试名称虽然不同,考的其实是同一件事:模型能不能读材料、使用工具、操作软件,再把一连串步骤做出结果,而不是只回答一道题。
表里连续两行都叫“智能体编程”,其实测的不是一回事。第一项长周期软件工程测试看的是模型能不能在真实软件项目里独立找到位置、修改多份文件、运行测试并不断修正。Opus 5 得到 68.8%,低于 GPT-5.6 Sol 的 72.7%,也略低于 Fable 5 的 69.7%。
第二项生产级代码质量测试不只看代码能不能运行,也看它能不能经得住正式审查。Opus 5 得到 53.4%,与 Fable 5 的 53.5% 几乎相同。两行使用不同题目和评分办法,数字不能上下比较,只能在同一行里比较不同模型。
所以,Opus 5 不是每项都第一。它在两项编程测试中都很强,却仍各有对手领先;法律、健康等专业任务也是如此。真正的变化是:上一代还在追赶,这一代已经能在很多实际工作中和最强模型正面比较。
![]()
成本效率:
同样的钱,效果更好
Anthropic 随后的推文说:“Opus 5 的效率也很高。在相同或更低的任务成本下,它的表现超过了其他模型。”
这些图比较的不是固定标价,而是测试中实际花了多少钱。图中的每个模型的5个圆点表示模型推理的强度,也就是“低 / 中 / 高 / 极高 / 最高”这些,推理强度越高,模型会花更多时间反复尝试和检查。
![]()
先看编程。这项测试要求模型直接操作开发环境,把一项编程任务从头做到尾。
Opus 5 在低档位推理强度时没有领先 GPT-5.6 Sol,但随着推理强度的提高,成绩提升到了 40% 以上;而Opus 4.8 即使提高推理强度,提升也已经不大。
![]()
而Opus 5多学科推理的提升没有编程那么夸张,但更稳定。
“人类最后的考试”允许使用工具时,Opus 5 从上一代的 57.9% 升到 64.7%,略高于 Fable 5 的 63.9%。
更重要的是,推理强度提高后,成绩依旧在涨,而不是只写得更长、花得更多。
![]()
电脑操作是这次最有说服力的项目之一。Opus 5 得到 70.6%,超过 Fable 5 的 66.1% 和 GPT-5.6 Sol 的 62.6%。
Anthropic 还特别指出,它只花了略高于 Fable 5 三分之一的任务成本,就超过了 Fable 5 的最好成绩。
这意思就是在浏览网页、操作软件和处理文件时,Opus 5 不只操作得更准,也更少因为反复试错把成本堆高。
![]()
业务流程测试更接近办公室里的真实委派,他测试的是从头到尾完成一项工作。
在这项上,Opus 5 的通过率为 26.0%,而其他几款模型集中在 17% 到 18% 左右。
按官方的说法,在花费相同的情况下,它的成绩约为下一名的 1.5 倍;即使只给最低投入,也能超过其他模型的最好结果。26% 本身仍然不高,说明复杂业务还不能放心地全部交给 AI;但从 17% 跳到 26%,已经进步很大了。
![]()
新问题求解的提升最明显。面对以前没见过的规则,模型需要自己找规律并不断试错,不能只靠记住的知识回答。Opus 5 得到 30.2%,约为下一名的三倍;GPT-5.6 Sol 为 7.8%,Opus 4.8 只有 1.5%。
不过,这个成绩的代价也最高。图中的约 2 万美元,是跑完整套测试的总花费,不是一次回答的价格。
这说明了提高推理强度并不是免费的:简单任务没必要开到最高强度;只有失败一次会浪费几小时,或者问题确实陌生又困难时,增加投入才可能划算。
最后为了防止大家误解,这里要特别说明的是,官方所谓的“更便宜”,是指完成同一件难事可能少走弯路、少操作几次工具,也不必改用更贵的 Fable 5。
也就是说,Opus 5的便宜,更多的来源是效率的提升,而不是价格的下降。
Opus 5 的API并没有降价,它仍按token收费,每百万个token,输入 5 美元、输出 25 美元,和 Opus 4.8 相同。
![]()
互动演示:
完成度有点高
Anthropic这次在发布页放了两个可以直接玩的作品。第一个是 [Aeolus T-1 风洞]。
![]()
它不只是播放一段烟雾绕过汽车的动画,而是在浏览器里实时计算空气怎样流过物体。用户可以改变风速、气流状态和计算速度,也能模拟车辆行驶时路面向后移动,并查看烟雾、涡流、尾流、压力等不同画面。
这个页面也会主动说明了自己的局限。它做的是近似计算,不是最高精度的工程模拟;计算分得不够细时,车辆受到的空气阻力只能作为参考。
但这个它真正展示了,Opus 5 能把代码、三维画面、物理知识和操作界面做成一个完整工具,同时告诉用户哪些结果不能太当真。当然,它仍不能代替专业风洞软件和正式工程计算。
第二个是 [Sectio 三维细胞]。鼠标移动时,细胞切面会跟着变化。细胞核、线粒体、内质网、高尔基体和溶酶体都可以点开,切开后还能继续查看里面的结构。
![]()
它不只是一张好看的细胞图。许多说明都附有论文链接和文献编号,还会告诉你引用的是总结性文章,还是直接做实验的论文。
页面甚至专门写出哪些地方为了演示而做了简化,哪些画法并不完全准确。这说明 了Opus 5 不只会生成画面,也能把操作、知识和资料核对放进同一个作品里。
但它展示的是制作科普和教学工具的能力,并不代表模型已经能独立得出生物学新发现。
Anthropic 还称,Opus 5 在蛋白质、化学和生物数据等测试中都超过 Opus 4.8。用光谱信息推测分子结构的内部测试提高了 10.2 个百分点;预测蛋白质变化会怎样影响功能,提高了 7.7 个百分点。两个互动演示不能证明这些分数,但至少让“更适合科学工作”有了更直观的样子。
![]()
安全表现:
更守规矩,更可靠
在“不对齐行为自动审计”中,Opus 5 得分最低。这里的“不对齐”,简单说就是模型为了完成目标而冒险、欺骗或违反规则,分数越低越好。
Opus 5 得到 2.30,低于 Opus 4.8 的 2.85、Mythos 5 的 2.81 和 Sonnet 5 的 3.35。Anthropic 因此称它是目前行为最可靠的 Claude 模型,也更遵守 Claude 的行为准则。
![]()
这不代表模型不会犯错,只说明在发布前的官方测试里,它更少为了完成目标去做难以撤回的事,也更不容易被人诱导绕过规则。对于让 AI 操作浏览器、修改代码和连续工作很久的人,这可能比多答对几道题更重要。
“在开源代码中发现漏洞并构造利用”这张图展示了 Anthropic 刻意保留的边界。
![]()
左图中,Opus 5 在 79.4% 的挑战里拿到非零分,接近 Mythos 5 的 80.0%,明显高于 Opus 4.8 的 61.5%。
但右图统计的是成功构造可用攻击程序的挑战数,Opus 5 只完成 4 个,Mythos 5 完成 13 个。也就是说,它更会帮助开发者发现和修复问题,却仍被限制去制作高风险攻击工具。
具体来说,Opus 5 可以检查源代码中的漏洞,但会拦截扫描编译后程序、主动攻击测试和制作攻击程序等高风险请求。
与 Fable 5 相比,这套安全拦截预计少触发约 85%;一旦触发,也可以把任务自动交给 Opus 4.8。普通开发者会少遇到误拦截,专业安全团队仍需使用经过审核和授权的专门通道。
合在一起看,Opus 5 的确更强,最明显的进步是能推进复杂任务、检查结果并减少半途失败。
它的开发接口与 Opus 4.8 同价;面对复杂任务时,通常也比价格高一倍的 Fable 5 更划算,但仍不是普通问答的低价选择。
已经在使用 Opus 4.8,或者经常处理大型代码项目、研究分析、长报告和跨软件流程的人最值得升级;聊天、翻译、摘要和短文写作继续使用更轻的模型就够了。
有一个很有趣的事情是,在Opus 5发布前的几个小时,英伟达CEO黄仁勋在X上发文力挺开源模型。
他在X上说:“开放模型能够增强安全与网络安全,加速创新与技术普及,并赋予各国技术自主权。世界既需要处于前沿水平的闭源模型,也需要处于前沿水平的开放模型。”
![]()
几个小时之后,Anthropic就带来了更强更有效率的Opus 5,结合之前Kimi K3发布带给世界的巨大冲击,Anthropic就好像要捂住黄仁勋的嘴一样,着实有点意思~
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.