![]()
智东西
编译 程茜
编辑 云鹏
智东西10月8日消息,今日凌晨,Anthropic发布其迄今最便宜、最快且功能最强大的迷你模型Claude Haiku 5.5,平均运行成本比Claude Haiku 4.5低约75%。
![]()
Anthropic的官方博客称,Claude Haiku 5.5适用于高吞吐量且对成本敏感的任务,可以处理快速且重复性的工作负载,例如摘要生成、数据整理、数据库查询、分类任务、实时客户支持以及浏览器相关操作等。Haiku 5.5也可以和Sonnet 5.5搭配,作为编程工作的子智能体使用。
在Artificial Analysis上, Haiku 5.5在AI分析指数上得分为43,在最高性能模式下,得分略高于GLM-5.3 Flash(42分)、Gemini 3.8 Flash(41分)和GPT-6 Luna(38分)。
![]()
Claude Haiku 5.5不超过10万token时的输出价格比DeepSeek-V4.1-Flash空闲时段还要便宜。
![]()
Claude Haiku 5.5的定价比Claude Haiku 4.5低90%,适用于请求量不超过10万个token的情况;而超过10万个token的请求可享受50%的折扣。在Claude Haiku 4.5版本中,有90%的请求属于上述范围。
![]()
此外,Anthropic还对全系模型性价比进行了优化,其将Claude Sonnet 5.5的缓存读取操作价格下调至一半,即每百万个token只需支付0.1美元(约合人民币0.67元),在大多数智能体任务场景下,其运行成本降低约20%;Claude Max和Team订阅用户还将拥有新的月度API积分奖励。
Claude Haiku 5.5现已可在所有平台上使用,包括Amazon Web Services、Google Cloud和Microsoft Azure。在Claude平台上,开发者可以立即开始使用claude-haiku-5-5。
一、动画效果实测惊艳,但部分场景比GPT-6 Luna贵12倍
不少开发者实测对比了Claude Haiku 5.5和GPT-6 Luna的表现。
一位开发者生成了斑马在奔跑的动画,其中从斑马的花纹、形态到背景,Haiku 5.5生成的画面都更为和谐自然。
![]()
另一位网友实测了Haiku 5.5和Sonnet 5.5作为子智能体协同使用,在下方的案例中,两个模型协同只花了不到1分钟就完成任务。
![]()
有开发者对比发现,Claude Haiku 5.5在相同场景下的成本是GPT-6 Luna的12倍。
下图中两个项目的API价格相同,在Claude Haiku 5.5平台上构建同一个动画化的体素式3D宝塔岛屿需要24.96美元(约合人民币167.27元),在GPT-6 Luna平台上为1.91美元(约合人民币12.8元)。
![]()
另一位开发者使用Haiku 5.5与GPT-6 Luna生成了夜班列车动画。GPT-6 Luna在54.6秒内以低于0.01美元(约合人民币0.07元)的价格,生成了上面的内容,列车在夜间的森林里运行,摄像机还会切换远景、近景。
Haiku 5.5则使用了5分钟12秒,成本为0.03美元(约合人民币0.21元),但开发者放出的案例中Haiku 5.5只生成了一张火车的静态图。
![]()
综合来看,Haiku 5.5在绝大多数上下文不超过10万token的自动化任务、浏览器与计算机操作、轻量智能体场景下可以实现更优的综合收益。但面对更为复杂,需要重度编程、极高复杂度的多步规划任务时,其能力仍存在短板,这类场景依旧需要选用更高阶模型来保障输出质量。
二、相比上代模型得分几乎翻倍,整体可对标GPT-6 Luna
Anthropic放出的基准测试表中,对比了Haiku 5.5与Haiku 4.5、GPT-6 Luna、Sonnet 5.5在知识工作、计算机操作、多学科推理、智能体编程、视觉推理等方面的表现。
8项基准测试中,Haiku 5.5的表现均超过了Haiku 4.5、GPT-6 Luna。其中相对于上一代的Haiku 4.5,Haiku 5.5的知识工作得分几乎翻倍,Terminal‑Bench智能体编程得分从0%上涨到39.2%,这说明Haiku 5.5已经具备较强的智能体能力。
整体来看,Haiku 5.5综合性能相比GPT-6 Luna更强,尤其在OSWorld电脑操作测试中具有明显优势。Haiku 5.5距离高端模型Sonnet 5.5仍有差距。
![]()
Haiku 5.5是Anthropic首款支持可调算力档位(adjustable effort setting)的Haiku系列模型。用户可以自主选择优先优化成本,或是优先优化模型智能度。
![]()
![]()
![]()
▲Haiku 5.5在不同算力档位下,三项基准测试的表现。
定价方面,Anthropic称,当提示词长度不超过10万token时,Haiku 5.5的性价比尤为突出。
下图展示了Haiku 5.5与Anthropic更先进模型之间的关键差异。
对于需要复杂智能体编程任务的场景,如那些通过Terminal-Bench 4.0进行评估的任务,Sonnet 5.5和Opus 5.5仍然是更好的选择。Haiku 5.5则更适合那些范围较为狭窄的任务,这些任务在Claude的先前版本中可能会因为成本过高而难以实现,比如压缩、摘要处理或子智能体工作等任务。
![]()
此外,本周Anthropic将向所有Max和团队订阅者提供新的月度API信用额度,供他们在Claude平台上使用。使用Max 5x的用户每月可获得100美元(约合人民币670元)的信用额度,使用Max 20x的用户则每月可获得200美元(约合人民币1340元),团队订阅者最多可获得500美元(约合人民币3350元)的信用额度。
面向开发者,他们同时更新了Claude Python与TypeScript SDK,新增计算机操作与浏览器操作的测试版能力支持。
三、对齐错误案例减少,Haiku 5.5网络安全保护更严格
Claude Haiku 5.5在几乎所有对齐评估指标上都取得了显著改进。相比上一代模型,研究人员发现的对齐错误案例大幅减少,同时,模型在应对错误行为时的协作意愿也更强。
根据其功能特性,Haiku 5.5的网络安全保护措施比Haiku 4.5更为严格。在网络安全方面,这些措施允许执行更广泛的防御任务,但无法阻止攻击者进行的渗透测试及其他攻击手段。
Haiku 5.5的生物安全机制与Sonnet 5、Sonnet 5.5以及Opus 5相同。这些机制允许研究相关生物学问题,但会限制那些可能带来危害的请求的访问权限。
结语:轻量模型也要有智能体能力,小模型不再只追求“便宜够用”
时隔一年,Anthropic更新了自家迷你模型,并升级了智能体能力,这或许将改写过去小模型主打“便宜够用”的定位,如今Haiku 5.5补齐了计算机操作、终端编码、图表推理短板,搭配可调推理档位,可以用更低成本承接10万token以内的智能体业务。
这意味着AI智能体开发的成本门槛被进一步压低,开发者不必动辄调用高价主力模型来做网页浏览、桌面自动化这类高频任务。不过值得注意的是,Haiku 5.5依然存在能力边界,在复杂场景高端模型的价值依旧不可替代。
未来,轻量模型或许也会成为智能体产品规模化落地的主力选型,这也会倒逼各家厂商在低成本智能体赛道加速竞争。
来源:Anthropic、X
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.