网易首页 > 网易号 > 正文 申请入驻

价格暴降90%,多项测试超GPT-6 Luna!Anthropic最便宜模型来了

0
分享至

编辑|勺嘴鹬

Anthropic 争夺 Agent 成本。


同志们,Anthropic 又来卷价格了。这次轮到 Claude 家族里最便宜的 Haiku。

10月7日,Anthropic 正式发布 Claude Haiku 5.5 ,号称自家迄今速度最快、能力最强、价格最低的小模型。

最夸张的是价格,每百万输入Token 最低只要 0.1美元,相比上代直接降价90%。



性能也没落下。按照 Anthropic 公布的测试结果,Haiku 5.5 在计算机操作、知识工作、Agent 编程等多个基准上超过 OpenAI 的 GPT-6 Luna,部分成绩甚至拉开了不小的差距。

而且,Haiku 5.5 还引入了可调节的推理强度,支持 100万Token 上下文窗口和最高 12.8万Token 输出。

至此,Anthropic 在短短 15 天里完成了 Claude 5.5 全家桶的更新:9 月 22 日 Opus 5.5 登场,9 月 28 日 Sonnet 5.5 发布,如今 Haiku 5.5 也正式加入。

这次,Anthropic 把重点放在了那些调用量巨大、对价格极其敏感的 AI 任务上。

多项成绩超过 GPT-6 Luna,计算机操作成功率 72.4%

按照 Anthropic 公布的 Benchmark 成绩,Haiku 5.5 相比上一代实现了大幅提升,在部分测试中还取得了比 GPT-6 Luna 更好的成绩。



其中最显眼的成绩来自 OSWorld。这是一项衡量 AI Agent 操作真实计算机能力的测试,要求模型完成跨应用、多步骤的操作任务。

在 OSWorld 2.1 离线任务子集上,Haiku 5.5 取得 72.4% 的成功率,上一代 Haiku 4.5 只有 15.7%,GPT-6 Luna 则为 48.9%。



知识工作方面,Haiku 5.5 在 GDPval-AA v2.1 中取得 1620 分,超过 GPT-6 Luna的1437分。Agent 编程测试 Terminal-Bench 4.0 中,两者成绩分别为 39.2% 和 16.4%。

不过,这些数据还有一个重要细节。Haiku 5.5 的最高 Benchmark 成绩,往往需要付出更多推理计算。

Haiku 5.5 首次在 Haiku 系列中引入可调节推理强度,开发者可以通过 effort 参数控制模型投入多少计算资源。

媒体VentureBeat注意到,在 Anthropic 公布的 Terminal-Bench 测试中, 39.2% 的成绩对应最大推理强度。切换至中等推理强度后,成绩降至约 20% ,而中等强度正是 Haiku 5.5 的默认设置。

第三方评测机构 Artificial Analysis 也观察到了类似现象。在其 Intelligence Index 评测中,Haiku 5.5 最大推理强度获得 43 分,中等推理强度为 34 分。同一评测下,平均每项任务成本分别约为 0.21 美元和 0.05 美元。

也就是说,模型可以通过增加推理预算换取更好的任务表现,但实际花费也可能明显增加。

Artificial Analysis 在自己的 Terminal-Bench 4.0 测试中,测得最大推理强度 33% 、中等强度 15% 的成绩。由于评测设置不同,这组数字与 Anthropic 官方结果存在差异。

这也是为什么看待小模型性能时,需要同时考虑推理强度、任务完成率和实际成本。

在更复杂的 Agent 编程任务上,Sonnet 5.5 依然具有明显优势:Terminal-Bench 4.0 成绩达到 70.6%。

Anthropic 也明确表示,Sonnet 和 Opus 仍然更适合复杂的 Agent 编程任务,Haiku 的优势集中在高频、范围明确的工作中。

价格直接砍到一折,和 GPT-6 Luna 正面竞争

如果说性能提升让 Haiku 5.5 有了竞争力,那么价格可能才是此次发布最重要的看点。Anthropic 为新模型设计了两档 API 价格。



对于提示长度不超过 10 万 Token 的请求,Haiku 5.5 的输入、输出单价都比上一代降低 90% 。超过这个门槛,价格仍比 Haiku 4.5 低 50%。

Anthropic 表示,上一代 Haiku 约 90% 的请求都处于 10 万 Token 以内。结合不同请求长度和 Token 消耗变化,公司预计 Haiku 5.5 完成同类任务的平均成本下降约 75%。

这里还有一个容易忽略的细节—— Haiku 5.5 换用了新的 Tokenizer 。根据官方开发者文档,同一段文本在新模型中产生的 Token 数量,可能比 Haiku 4.5 多约 30% ,具体增幅取决于内容。因此,API 单价下降 90% ,并不代表每项任务的账单都能减少 90% 。

另一个值得关注的对手是 GPT-6 Luna 。OpenAI 给出的 Luna 基础定价同样为每百万输入 Token 0.1 美元、输出 0.5 美元,缓存读取价格也与 Haiku 5.5 的低价档一致。

不过,两家公司的长上下文计费门槛存在明显差异。

Haiku 5.5 在提示超过 10 万 Token 后进入更高价格档;GPT-6 Luna 则在输入超过 27.2 万 Token 后才触发长上下文加价。这意味着,在 10 万至 27.2 万 Token 之间的请求中,Luna 的单位 Token 价格具有优势。

至于最终完成一项任务哪款模型更省钱,还需要结合实际 Token 用量、推理预算和任务成功率判断。

放到整个市场来看,Anthropic 也在向其他低价模型施加压力。

VentureBeat列出的同期 API 价格显示,Google Gemini 3.5 Flash-Lite 每百万输入 Token 价格为 0.3 美元、输出 2.5 美元;Gemini 3.8 Flash 分别为 0.75 美元和 3.75 美元。

当然,不同模型的能力定位、缓存策略和任务表现各不相同,这些数字首先反映的是 API 价格竞争。

小模型价格战,正在进一步升级。

一周 800 万次调用,企业开始让小模型给大模型打工

Haiku 5.5 到底适合干什么?

Anthropic 给出的场景包括文档摘要、信息分类、数据库查询、上下文压缩,以及在复杂 Agent 工作流中担任 Subagent。

这背后有一个很现实的问题:如今的 Agent 越来越复杂,一项任务往往需要多次调用模型。如果每个步骤都交给大模型处理,成本会快速累积。

金融 AI 公司 Rogo 提供了一个例子。在它的工作流中,一个能力更强的大模型负责制作财务演示文稿。处理其中某张幻灯片时,Haiku 5.5 Subagent 进入企业 10-K 年报,找到需要的业务收入数据,再把结果交给主模型。

对这种任务,模型需要快速、准确地完成信息查找和提取。Rogo 认为,Haiku 5.5 在准确率、速度和价格之间达到了适合大量重复调用的平衡。

企业内容管理平台 Box 也给出了早期测试结果。相比 Haiku 4.5,Haiku 5.5 的内部评测成绩提高 11 分,延迟下降约 50%。

Box 表示,这让新模型适合成本报告、财务摘要、周期性审查等需要规模化运行的分析工作。不过,Box 没有公开完整的评测标准。

Asana 的测试则覆盖 Bug 分类、项目建立、大型项目组合搜索等 Agent 任务。根据其披露的结果,相比当前使用的模型,Haiku 5.5 让任务完成延迟降低超过 30% ,单轮 Agent 推理速度最高提升 2.5 倍。

另一个更能体现成本价值的例子来自 AlphaSense。这家公司的Ask in Document 功能每周需要处理约 800 万次调用,主要回答针对一份或几份文档的具体问题。

在 400 个测试查询中,Haiku 5.5 的内部评测得分达到 0.84,而 Haiku 4.5 为 0.76。

如果一款模型每周要被调用数百万次,哪怕每次只节省很少的钱,长期累积下来的成本变化也可能相当可观。

这些数据来自 Anthropic 披露的早期客户反馈,具体工作负载、对照模型及评价标准并不完全一致,还需要更多独立测试。

Sonnet 跟着降价,Claude 5.5 全家桶开始拼成本

除了 Haiku 5.5,Anthropic 还同步调整了 Sonnet 5.5 的定价。从 10 月 7 日起,Sonnet 5.5 的缓存读取费用降低 50%,从每百万 Token 0.2 美元降至 0.1 美元。

Anthropic 预计,这项调整可以让多数 Agent 工作负载的成本再降低约 20%,实际降幅取决于应用重复使用缓存上下文的程度。

对于需要反复读取长对话历史、工具说明和任务上下文的 Agent 来说,缓存成本会直接影响系统的长期运行开销。

Anthropic 同时为 Claude Max 和 Team 订阅用户推出每月 API 额度:Max 5x 用户 100 美元,Max 20x 用户 200 美元,Team 用户共享最高 500 美元。

这些额度可用于 Claude 平台上的模型调用,鼓励更多订阅用户尝试构建自己的 Agent 和应用。

开发者方面,Haiku 5.5 已通过 Anthropic API、Amazon Bedrock、Google Cloud 和 Microsoft Azure 等平台提供服务,API 模型 ID 为。

claude-haiku-5-5

Anthropic 也更新了 Python 和 TypeScript SDK ,新增处于 Beta 阶段的浏览器操作与计算机操作支持。

至此,Claude 5.5 系列的产品分工已经相当清楚。

Opus 5.5 负责高难度、复杂推理任务,Sonnet 5.5 覆盖日常复杂工作与编程, Haiku 5.5 则主攻调用量大、成本敏感、要求快速响应的任务。

从 9 月 22 日到 10 月 7 日,Anthropic 用了 15 天完成这一轮产品更新,三个型号都在强调性能和成本效率。

Haiku 5.5 的发布,也让一个趋势更加明显。随着 Agent 逐渐从演示走向实际应用,开发者必须考虑整套系统的调用成本。一次任务里哪些步骤需要更强的模型、哪些可以交给小模型,以及不同模型之间如何分配工作,都会影响最终的商业可行性。

对 Anthropic 来说,Haiku 5.5 最有吸引力的地方,或许就在这里:它让更多原本因调用成本过高而难以规模化的任务,开始具备经济上的可行性。

小模型的竞争,已经开始深入 Agent 系统的每一个执行环节。

参考资料

https://www.anthropic.com/claude-haiku-5-5

https://venturebeat.com/technology/anthropic-launches-claude-haiku-5-5-with-90-api-price-reduction-matching-gpt-6-luna

https://x.com/claudeai/status/2107894042235166750

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
尊界V800现刹车踏板断裂事件,鸿蒙智行销售称被消费者追问了一天

尊界V800现刹车踏板断裂事件,鸿蒙智行销售称被消费者追问了一天

新京报
2026-10-08 18:28:14
沈阳新娘远嫁杭州,娘家30口人自驾送亲,新郎只愿付当天住宿费

沈阳新娘远嫁杭州,娘家30口人自驾送亲,新郎只愿付当天住宿费

兰姐说故事
2025-08-21 20:05:04
曾夺走 2 亿人生命的鼠疫再敲警钟,俄罗斯实验室鼠疫事件的 4 重警示

曾夺走 2 亿人生命的鼠疫再敲警钟,俄罗斯实验室鼠疫事件的 4 重警示

怪味历史连连看
2026-10-07 15:47:32
WTT中国大满贯:国乒4人晋级女单8强!陈幸同3-0横扫大藤沙月

WTT中国大满贯:国乒4人晋级女单8强!陈幸同3-0横扫大藤沙月

全言作品
2026-10-08 20:55:18
为谢贤秘密生子真相大白!Coco近况曝光,难怪自曝猛料按耐不住

为谢贤秘密生子真相大白!Coco近况曝光,难怪自曝猛料按耐不住

娱说瑜悦
2026-10-06 15:48:41
远东集团赚大陆钱捐“台独”?被大陆精准的反制后,发展咋样?

远东集团赚大陆钱捐“台独”?被大陆精准的反制后,发展咋样?

暮雪无痕
2026-09-20 18:41:20
蔡天凤被害3年后,再看丈夫谭方骏和蔡母现状,方媛的话有人信了

蔡天凤被害3年后,再看丈夫谭方骏和蔡母现状,方媛的话有人信了

傲傲讲历史
2026-10-08 09:48:40
64岁董文华,瘫痪母亲、下岗亲人,丈夫的选择让人泪目

64岁董文华,瘫痪母亲、下岗亲人,丈夫的选择让人泪目

阿嬍体育评论
2026-10-08 11:27:18
苹果手机自带收音机功能!不用流量不用联网,9成用户一直没用对

苹果手机自带收音机功能!不用流量不用联网,9成用户一直没用对

小蜜情感说
2026-10-08 01:23:14
正当年的人,别倒在领退休金前;部分70后80后可能熬不到领退休

正当年的人,别倒在领退休金前;部分70后80后可能熬不到领退休

白米饭怎么吃
2026-10-06 21:21:08
10月7日,真相逐渐浮出水面:就是055驱逐舰拉爆了美军驱逐舰!

10月7日,真相逐渐浮出水面:就是055驱逐舰拉爆了美军驱逐舰!

果妈聊娱乐
2026-10-07 16:12:28
为亲人喊冤14年的河南农妇,终于把自己也喊进了监狱

为亲人喊冤14年的河南农妇,终于把自己也喊进了监狱

塔子山评说
2026-06-29 16:49:51
实体店末日?人民日报怒批,死的不是实体店,是 20 年不变经营脑!

实体店末日?人民日报怒批,死的不是实体店,是 20 年不变经营脑!

抽象派大师
2026-08-29 18:48:17
嫌网红太贵,连锁面包店让财务总监自己上,结果近千万人围观!网友:不愧是管钱的!

嫌网红太贵,连锁面包店让财务总监自己上,结果近千万人围观!网友:不愧是管钱的!

新欧洲
2026-10-08 20:09:40
2026年诺贝尔文学奖揭晓

2026年诺贝尔文学奖揭晓

农视网
2026-10-08 21:39:06
尊界的刹车踏板断了,但大老板的咖啡不能洒

尊界的刹车踏板断了,但大老板的咖啡不能洒

吃瓜体
2026-10-08 11:36:45
AI编程没那么好玩了

AI编程没那么好玩了

我是一个养虾人
2026-10-07 00:30:56
莫言:永远不要期望一个没有血缘关系的人,能站在你的角度替你考虑|成年人最大的清醒

莫言:永远不要期望一个没有血缘关系的人,能站在你的角度替你考虑|成年人最大的清醒

杏花烟雨江南的碧园
2026-07-27 11:15:03
鲁比奥雅典卫城惊人演讲:西方文明生死存亡,欧洲必须醒醒!

鲁比奥雅典卫城惊人演讲:西方文明生死存亡,欧洲必须醒醒!

旧窗老街
2026-10-08 19:53:13
中国为什么不信巴基斯坦和俄罗斯?说穿了,中国早清楚一个真理:瓜达尔港、中俄天然气背后都有算盘,看懂才知主动权在谁手里

中国为什么不信巴基斯坦和俄罗斯?说穿了,中国早清楚一个真理:瓜达尔港、中俄天然气背后都有算盘,看懂才知主动权在谁手里

谈史论今1
2026-10-05 20:16:51
2026-10-09 04:03:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14155文章数 142746关注度
往期回顾 全部

科技要闻

江淮汽车回应"尊界V800刹车踏板支架断裂"

头条要闻

女局长被举报婚内出轨至少9人 大量亲密聊天记录公布

头条要闻

女局长被举报婚内出轨至少9人 大量亲密聊天记录公布

体育要闻

30天30队·鹈鹕:胖虎又一年“如果”

娱乐要闻

演员王晓慧刚担女主,就被曝已婚生子

财经要闻

央行:中国从不搞竞争性货币贬值

汽车要闻

特别版配色/碳纤尾翼 2027款深蓝L06将于10月9日上市

态度原创

数码
家居
教育
艺术
时尚

数码要闻

苹果发布App Store中国生态研究:2025交易规模约4万亿元

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

回顾:“吊瓶班”学生无一人考上一本!网友:表演式努力骗人骗己

艺术要闻

炸裂!龙门石窟首次发现造像琉璃眼珠,千年佛像竟“睁眼”了,熠熠闪光品相逆天!

西装+裙子,穿出大女人的浪漫与时髦

无障碍浏览 进入关怀版