就在刚刚,据《华尔街日报》报道称,OpenAI 因内部测试发现模型存在隐瞒行动、未经授权调用外部工具等安全问题,取消了原定 10 月份发布的 GPT-6.1 Astra。
![]()
不过,就在几乎同一时间,说好要一起放缓模型迭代速度的 Anthropic 却赶在 OpenAI 开发者大会前夕,正式发布 Claude Sonnet 5.5。
![]()
而作为 Claude 5.5 家族的第二款模型,Sonnet 5.5 延续了 Sonnet 系列的定位,主要处理边界清晰的日常任务,包括修复代码、制作文档、生成 Slides 和整理电子表格。
![]()
与上一代 Sonnet 5 相比,新模型输出速度提高超过 30%,完成大多数任务的实际成本最多降低 30%。
Anthropic 对它的定位也很明确。
Opus 5.5 继续负责需要长期推理和复杂判断的高难度工作,Sonnet 5.5 则试图用更低的成本,提供接近旗舰模型的能力与完成度。面向高并发、成本敏感场景的 Haiku 5.5,也将在未来几周加入产品线。
Sonnet 5.5,已经站在旗舰门口
Sonnet 5.5 最明显的提升出现在 Agent 编程领域。
在测试模型处理复杂命令行任务的 Terminal-Bench 4.0 中,Sonnet 5.5 获得 70.6% 的成绩,上一代 Sonnet 5 只有 10.3%。按照 Anthropic 公布的数据,它甚至超过了 Opus 5.5 在 Xhigh effort 档位下取得的 66.4%。
![]()
在 FrontierCode 1.1 中,Sonnet 5.5 的最高成绩为 46.3%,距离 Opus 5.5 的 54.4% 仍有差距,但已经明显高于 Sonnet 5 的 42.4%。
![]()
在使用真实 Cursor 编程任务构建的 CursorBench 4.0 中,Sonnet 5.5 获得 55.5%,与 Opus 5.5 的 57.8% 只差约两个百分点。
![]()
Anthropic 表示, 早期测试者普遍提到 Sonnet 5.5 理解代码库的速度更快,也更擅长同时调用多个工具,因此完成同一项任务需要的步骤和输出 token 更少。
Epic Games 在测试后表示,Sonnet 5.5 已经能够处理数万行游戏系统代码,在系统设计审查、数据流分析和持续数小时的任务中,表现达到了以往高阶模型的水平,同时对提示词的依赖也有所降低。
相比编程成绩,Sonnet 5.5 在知识工作上的变化可能更值得普通用户关注。
GDPval-AA 用来自 44 种职业和 9 个行业的真实任务衡量模型能力,Sonnet 5.5 获得 1844 分,几乎追平 Opus 5.5 的 1846 分,比 Sonnet 5 高出近 400 分。
在测试复杂办公交付的 AA-Briefcase 中,它获得 1811 分,与 Opus 5.5 的 1822 分同样接近。
![]()
计算机操作测试 OSWorld 2.1 中,Sonnet 5.5 的成绩从上一代的 57% 提高到 80.1%,距离 Opus 5.5 的 81.8% 只差 1.7 个百分点。图表理解测试 Chartography 中,它从 15.6% 提高到 61.6%,超过 GPT-6 Sol 公布的 53.6%。
Anthropic 还用一家上市公司的财报、电话会议记录和现成模板进行内部测试,让 Sonnet 5.5 制作一份 10 页的经营回顾 Slides。两名专业人士审阅后认为,模型生成的初稿已经可以直接发送,无需继续修改。
![]()
不过,Anthropic 并没有将 Sonnet 5.5 描述成 Opus 的替代品。
在需要持续判断、处理开放问题和执行超长任务时,Opus 5.5 依然更强。Sonnet 5.5 的真正价值,是把过去需要旗舰模型完成的一部分工作,带到了更便宜、更快的档位。
![]()
首批实测玩家已经用它创造世界
模型发布后,网友很快开始用 Sonnet 5.5 制作游戏、3D 场景和交互工具。
比如开发者 Amir Mušić 使用 Opus 5.5 与 Sonnet 5.5,重建了自己童年生活的城市街区。整个项目以 GMI Cloud 开源的 Sakura Crossing 为基础,耗时约一小时,token 成本约 55 至 57 美元。
最终成品包含板式住宅、空旷院落、金属游乐设施和车库,用户可以像进入游戏一样在街区中自由移动。
![]()
BridgeBench 则让 Fable 5.1、Opus 5.5 和 Sonnet 5.5 完成相同的黑洞并合任务。
![]()
Fable 5.1 耗时 4 分 44 秒,成本 1.22 美元;Opus 5.5 耗时 6 分 08 秒,成本 0.69 美元;Sonnet 5.5 只用了 4 分 14 秒,成本为 0.34 美元,在三款模型中速度最快,费用约为 Opus 5.5 的一半。
![]()
类似的差距也出现在熔岩灯 UI 测试中。Opus 5.5 用时 9 分 35 秒,花费 1.27 美元;Sonnet 5.5 用时 5 分 44 秒,花费 0.47 美元。后者生成的辉光、环境照明和交互细节已经接近 Opus,耗时却减少了近四分钟。
![]()
Sonnet 5.5 对视觉设计的理解,也成为本次更新中最容易被感知的变化。
Claude 官方展示了网友做的秋叶模拟器、手绘风流程图工具、恐龙历史动画和弹跳球物理模拟。使用相同提示词时,5.5 生成的画面层次、运动效果和交互完整度,均明显高于 Sonnet 5。
![]()
在达斯·维达 3D 模型测试中,哪怕是碰上 GPT-6 Sol,Sonnet 5.5 的头盔、披风和身体比例也更加完整。
![]()
另一次纽约城测试的效果对比则更直观。今年 6 月,Sonnet 5 花费 4 小时仍未解决相机移动问题,Sonnet 5.5 则成功控制镜头完成了一次纽约观光飞行。
![]()
开发者 st1ne 还展示了一个有趣的案例。
![]()
他要求 Sonnet 5.5 解释特斯拉 Cybertruck 的驱动原理,模型随后制作出一个可操作的 3D 驱动系统。
用户可以将时间放慢 1000 倍,观察三相电流如何合成旋转磁场,也可以更换转子结构、提高电机转速,并查看制动时能量如何回流电池。
![]()
游戏生成同样出现了明显进步。有人通过一次提示生成了可运行的 Mario Kart 风格赛车游戏。
![]()
中端模型开始成为 AI 主力军
至于 API 价格方面,Sonnet 5.5 延续了 Sonnet 5 的 API 价格,每百万输入 token 为 2 美元,每百万输出 token 为 10 美元,缓存读取为 0.20 美元。相比 Opus 5.5,它的输入和输出价格均低 50%。
![]()
Anthropic 表示,新模型完成相同任务通常需要更少的步骤和 token,因此大多数工作中的单任务成本最多可以下降 30%。在部分测试中,Sonnet 5.5 使用 Low 或 Medium effort,能够以约十分之一的任务成本超过 Sonnet 5 的最高成绩。
外部评测机构 Artificial Analysis 给出的结果则截然不同。
Sonnet 5.5 在 Artificial Analysis Intelligence Index 中获得 56 分,仅比 Opus 5.5 max 低 2 分,相比 Sonnet 5 max 提高 18 分。一眼望去,Claude 包揽了 AA 指数的前三甲。
![]()
不过,Sonnet 5.5 在 max effort 下平均每项任务会输出约 19.3 万 token,成为该机构测试过输出量最高的模型。
![]()
按照 Artificial Analysis 的计算,Sonnet 5.5 max 完成一次任务的平均成本约为 7.60 美元,比 Sonnet 5 max 高约 50%。
官方所说的成本下降,主要适用于模型能够用更少步骤完成的常规任务;当用户把 effort 调到最高档,让模型持续思考并检查结果时,实际费用仍可能超过上一代。
此外,随着网络安全能力提升,Sonnet 5.5 成为首款在发布时采用旗舰级网络安全措施的 Sonnet 模型。Anthropic 还首次为 Sonnet 系列加入防止推理提取的安全分类器,用于阻止攻击者通过大量虚假账号批量提取模型能力。
Preserved thinking 的覆盖范围也被扩大,模型的思考内容将与创建会话的账号绑定。普通开发者很难感受到变化,但在不同账号之间迁移 Claude Code 会话时,可能需要调整使用方式。
目前,Claude Sonnet 5.5 已经登陆 Claude 全平台,同时通过 Amazon Web Services、Google Cloud 和 Microsoft Azure 提供。开发者可以在 Claude Platform 中调用 claude-sonnet-5-5,并继续使用零数据保留选项。
![]()
模型提供 Low、Medium、High、Xhigh 和 Max 五档 effort。Claude 应用与 Claude Code 默认使用 Medium,Claude Platform 默认使用 High。较低档位更适合高频日常任务,较高档位会延长推理时间,并增加检查次数与 token 消耗。
从产品定位看,过去,旗舰模型负责展示能力上限,中端模型则承担速度和价格优势。如今,Sonnet 5.5 已经在编程、电脑操作、文档制作和视觉生成上逼近 Opus,大有越级提升之意。
说到这里插个题外话,每次文章写到 Claude,评论区都会有读者吐槽 Claude 封号严重,其实也没有继续关注的必要。
类似的想法并不难理解,因为我也已经被封了 6 个号,但大模型竞赛是一个高度内卷的修罗场。
当头部模型用中端价格提供接近旗舰级的体验,国内外的友商们都会感受到实打实的压力,并因此重新调整定价、拉升推理速度、上线更硬核的代码与图表功能。
因此,我们当然无须忠于任何一家厂商,却值得关注谁在改变行业标准,因为即便我们可以不用 Claude,却也很难避开一个被 Claude 重新定价、提速并抬高能力下限的 AI 市场。
我们正在招募伙伴
简历投递邮箱hr@ifanr.com
✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.