今天凌晨,Anthropic 发布了 Claude 5.5 系列的第二个模型 Sonnet 5.5,看 bench... 恐怖如斯
![]()
Terminal-Bench 4.0:各思考档位的成绩与单次成本
它的价格和 Sonnet 5 一样,每百万 token 输入 2 美元、输出 10 美元,价格是 Opus 5.5 的一半
在速度方面,Sonnet 5.5 也是遥遥领先,比 Sonnet 5 快 30% 以上。由于完成同样的工作用的 token 更少,官方测试里单个任务的成本最多能再低 30%
按官方的定位,Opus 5.5 负责需要持续判断的复杂开放任务,Sonnet 5.5 更擅长边界清楚的日常任务、修 bug,以及做文档、幻灯片和表格,对设计也很有眼光
面向大批量、低成本场景的 Haiku 5.5 会在未来几周推出
![]()
Sonnet 5.5 完整 benchmark
Sonnet 5.5 在很多工作中,几近追平 Opus 5.5,也还是第一个只看截图就通关《宝可梦 红》的 Sonnet 模型
编程
![]()
Terminal-Bench 4.0:各思考档位的成绩与单次成本
Terminal-Bench 测的是在命令行里完成多步骤专业任务。每个点对应一个思考档位(effort),档位越高,模型想得越久,单次成本越高,分数通常也越高;越靠左上,同样的钱换来的能力越多
Claude 应用里默认的 Medium 档位,Sonnet 5.5 已经远超 Sonnet 5 各档位的最好成绩,单次成本不到后者的十分之一。开到 Max 档位后,它的曲线在最右端越过了 Opus 5.5,得到 70.6%。GPT-6 Sol 在这项测试上没有公开成绩,图中用的是 GPT-5.6 Sol
![]()
FrontierCode 1.1:代码改动能否直接合入
FrontierCode 看的是代码改动能不能不经人工修改直接合入,超出任务范围的改动即使写得好也会扣分。High 档位下,Sonnet 5.5 比同档位的 Sonnet 5 高 10 个百分点,单次成本约为十五分之一
FrontierCode 上还有个细节:Sonnet 5.5 在 Xhigh 档位得到 52.1%,开到 Max 反而降到 46.2%。原因是 Max 档位下它更常调用 Claude Code 的代码审查 Skill,把审查拆给一批子 Agent 去做。Cognition 检查的两个案例里,这导致了超时,或者改动超出了任务范围
![]()
CursorBench 4.0:来自真实 Cursor 编程会话的任务
CursorBench 的任务取自真实的 Cursor 编程会话。Sonnet 5.5 最好成绩 55.5%,和 Opus 5.5 的 57.8% 相差约两个百分点
早期测试者提到,Sonnet 5.5 读懂一个代码库的速度很快。在同题对照里,它比 Sonnet 5 更多地把工具调用合并成一批,步骤更少,成本也更低。客户的反馈里有不少具体数字:
Epic Games:在系统设计审计和数据流审查中达到了更高一档模型的质量要求;处理了数万行游戏系统架构代码,能跑数小时的任务,响应依旧很快,提示词也不用写得那么细
Base44:在 118 个真实应用构建中,产出质量与 Opus 5 持平;平均每个应用迭代 3.6 次,Opus 5 要 7.7 次。它的工具调用失败次数在所有对比模型中最少,也很少中途停下来问用户,构建不容易卡住
Unity:任务要在运行时检查、改动真的生效才算完成,Sonnet 5.5 的大部分工作通过了这项检查;在多步骤 Unity 编辑器与编程测试中完成了 90% 的任务
CodeRabbit:在不同复杂度的代码审查里判断都好于 Sonnet 5,输出 token 明显更少,Sonnet 5 爱频繁联网搜索、token 用量高的毛病都没有了。简单和中等难度的审查会先切换过去
Lovable:思考步骤更少也更稳,编程测试里工具调用少了三分之一,shell 运行次数约减半
SpaceXAI:CursorBench 4.0 拿到 55.5%,仅次于 Opus 5.5
Every:写代码快,迭代时能很快调整方向,需要的时候也能长时间工作;它继承了 Opus 5.5 写作更自然的一部分改进,用起来更有意思
Creator:由 Opus 5.5 定好游戏的架构和整体框架后,可以放心交给 Sonnet 5.5 去实现
![]()
AA-Briefcase v1.1:知识工作质量与单任务成本
GDPval-AA 用 44 种职业、9 大行业的真实任务测试模型。Sonnet 5.5 与 Opus 5.5 几乎持平,比 Sonnet 5 高约 400 分;AA-Briefcase 也是类似的格局。电脑操作和图表识别接近 Opus 5.5,在长周期的知识工作上明显强于 Sonnet 5 和 GPT-6 Sol
测试者还提到一些不太好量化的变化:聊起来更自然,也更懂设计,会给用户界面多做一层打磨,能按幻灯片模板做出几乎不用改的演示文稿。Anthropic 做过一次内部测试:给它一家上市公司的季度财报材料、电话会记录和一份幻灯片模板,让它做一份 10 页的经营回顾。两位专家评审后认为,初稿可以直接发出去
企业客户的结果:
Slack:不改任何提示词,离线 Slackbot 评测几乎全部好于 Sonnet 5,步骤更少,输出 token 少约 14%
Zendesk:用数百个真实客服场景测试回复和升级处理,错误决策比目前生产环境里的 Claude 模型更少,工单处理快了 20%
Balyasny Asset Management:在 2441 个金融任务上(问答、信息抽取、分析、预测)成绩高于 Sonnet 5,每个回答约用 12.1 万 token,Sonnet 5 要 49.7 万;在参与对比的 7 个模型里,大批量工作流的质量成本比最好
Box:会回到源文档复核数据,找出了 Sonnet 5 漏掉的错误;准确率更高,速度快 2.4 倍,总 token 少 12%
Atlassian:Rovo Agent 每月为客户执行数百万次操作,换成 Sonnet 5.5 后运行速度最多比 Sonnet 5 快 30%
![]()
三款模型的 API 定价
Sonnet 5.5 每百万 token 输入 2 美元、输出 10 美元,缓存写入 2.5 美元,都是 Opus 5.5 的一半;缓存读取两者相同,都是 0.2 美元。定价和 Sonnet 5 一样,但完成同样的工作用的 token 更少,所以实际花得更少
在多项测试中,Sonnet 5.5 用 Low 或 Medium 档位,就能超过 Sonnet 5 的最好成绩,单任务成本约为十分之一
官方的说法是,Sonnet 5.5 在较低档位时与 Opus 5.5 配合得最好,这时它单任务成本更低;开到较高档位,它能以相近的成本拿到相近的成绩
为了展示速度,官方让 Sonnet 5 和 Sonnet 5.5 用同一句提示词各写一个单文件网页。第一个是“用一个 HTML 文件做 400 只椋鸟的群飞”:
椋鸟的群飞
Sonnet 5.5 输出 4158 个 token 就写完了,鸟群已经飞了一阵,Sonnet 5 还在写代码,最后用了 4649 个 token
第二个是“风吹沙丘”,Sonnet 5.5 用了 2720 个 token,Sonnet 5 用了 3088 个:
风吹沙丘
思考档位可以在成本、速度和质量之间调节。Claude Code 和 Claude 应用默认是 Medium,Claude Platform 默认是 High。档位低,回答更快、token 更少,适合日常工作;档位高,Claude 会想得更久,检查也更仔细
安全方面,这是第一个配备网络安全防护的 Sonnet,日常开发里的找 bug、修 bug 不受影响,高风险的网络安全任务会转回 Sonnet 5 处理
上线
Sonnet 5.5 已经在所有平台上线,包括 AWS、Google Cloud 和 Microsoft Azure,API 模型名是 claude-sonnet-5-5,和 Opus 5.5、Sonnet 5 一样支持零数据留存
如果你之前关闭思考来用 Sonnet,迁移前需要换成新的 between_tools 设置,它会继续关闭前置思考
〔待插入视频:sonnet-5.5-launch-film.mp4,官方发布短片,13 秒〕
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.