![]()
整理 | 冬梅
三个月前,Anthropic 发布 Fable 5 时,试图回答一个问题:当模型需要连续工作数小时甚至数天,它能否一直记住目标、调用工具、检查结果,并在无人监督的情况下把任务做完?
现在,Anthropic 带着 Fable 5.1 回来了。
Fable 5.1 和 Mythos 5.1 正式发布
当地时间 9 月 1 日,Anthropic 正式发布 Claude Fable 5.1 和 Claude Mythos 5.1。
按照官方定义,两者使用相同的底层模型,区别不在“智力”,而在安全保护级别:Fable 5.1 面向普通用户和企业全面开放,Mythos 5.1 则只通过受信任访问计划,向部分网络安全和生命科学机构提供。
![]()
从版本号看,这只是一次“.1”升级。但从实际变化看,Anthropic 显然不只是在修补 Fable 5。新模型在智能体科学研究测试中的成绩超过前代两倍,在编程、知识工作、电脑操作和长时间任务中全面提升;与此同时,Agent 工作负载的实际调用成本最高下降约 45%。
更重要的是,Anthropic 这一次没有只谈模型跑分。价格、缓存、数据留存、安全误判、漏洞研究权限和企业部署架构,几乎占据了发布内容的一半。
Fable 5.1 和 Mythos 5.1 之间的关系,是理解这次发布的第一把钥匙,它们是同一个模型的两种部署形式。
Fable 5.1 加入了面向公众和企业环境的网络安全、生物安全保护机制。当请求触发风险规则时,一部分任务会被阻止,另一部分则会被路由到能力相对较弱的 Opus 模型。Mythos 5.1 则保留了更多原始能力,但只能由经过审核的机构访问。
换句话说,Anthropic 正在尝试将“模型能力”和“模型开放程度”拆开管理:不再为了降低风险,直接削弱整个模型,而是根据用户身份、任务类型和使用环境,提供不同层级的能力。
核心亮点是啥?
那这两款“神级”模型,亮点是什么?
事实上,Fable 5.1 的核心变化,可以概括为:能力上限更高、缓存读取更便宜,但把推理强度拉满,完成一次任务仍可能比前代更贵。
在 Terminal-Bench 4.0 上,Fable 5.1 得分为 55.8%,而关闭部分限制的 Mythos 5.1 达到 60.9%。两者的能力差距,很大程度上并不是底层模型造成的,而是 Fable 的安全系统在部分网络安全任务中介入的结果。
在 Anthropic 公布的几组数据中,变化最显著的是智能体科学研究。
在 Terminal-Bench-Science 0.1 上,Fable 5.1 取得 52.6% 的成绩,Fable 5 只有 24.7%,Opus 5 为 29.0%,GPT-5.6 Sol 为 22.4%。相较前代,Fable 5.1 的成绩不只是小幅提高,而是达到原来的两倍以上。
![]()
Terminal-Bench-Science 0.1:每个模型的标准误差为±3.5–4.5 分。公开排行榜(每个任务 3 次试验,使用 Claude Code 框架)显示 Claude Opus 5 的准确率为 30.0%,Claude Fable 5 的准确率为 21.4%;我们的实验设置分别复现了这两个结果,准确率分别为 29.0% 和 24.7%,均在噪声范围内。
这些数字表明,Fable 5.1 的提升并不局限于代码生成。它在操作电脑、跨领域推理、研究任务和知识工作中,均超过了前代,也在多数官方测试中超过成本更低的 Opus 5。
知识工作的成绩同样登顶,但 与 Opus 5 的差距并不明显。Fable 5.1 在 GDPval-AA v2 和 AA-Briefcase 中的 Elo 评分分别达到 1853 和 1694,较前代提高 130 分和 122 分。
不过,它在前者相对 Opus 5 的领先仍处于置信区间内,后者则与 Opus 5 的 1685 分基本持平。具体来看,它的优势主要集中在分析质量和评分标准符合度,呈现效果并未同步领先。
![]()
价格调整则主要针对 Agent 反复读取上下文的成本。Fable 5.1 的缓存读取价格从每百万 Token 1 美元降至 0.25 美元,降幅 75%;标准输入、输出价格仍为每百万 Token 10 美元和 50 美元,缓存写入价格维持 12.5 美元。上下文窗口保持 100 万 Token,支持文本和图像输入。
但缓存降价,并不意味着所有任务都更省钱。在最高推理强度下,Fable 5.1 完成一项智能指数测试任务平均花费 3.76 美元,比 Fable 5 高出约 20%,原因是输出 Token 用量约为前代的 1.7 倍。即便缓存降价已为每项任务节省约 1.40 美元,也没有完全抵消输出增加带来的费用。
![]()
降低推理强度后,性价比会有所改善:xhigh 档位的智能指数为 65 分,单项任务成本降至 2.72 美元,但仍高于 Opus 5 最高档位的 2.34 美元,后者得分为 63 分。Fable 5.1 同时占据了智能水平与输出 Token 效率的高端帕累托前沿,意味着它在高能力区间更有效率,但这不等于美元成本最低。
这次升级的价值由此变得清晰:Fable 5.1 抬高了复杂任务的能力上限,却没有消除能力、推理用量与成本之间的取舍。对于开发者,真正需要判断的仍是,多花的钱,能否换来原本做不成的任务。
不再满足于“修代码”,而是追查根因
Anthropic 在发布材料中反复强调,Fable 5.1 会减少看似快捷、实际降低质量的“走捷径”行为,更倾向于寻找问题的根本原因。
投资机构 Millennium 提供了一个颇具代表性的案例。
该机构的一段内部代码存在一个约百万次运行才出现一次的崩溃问题。工程师花了四五年时间,也没有解释清楚原因,包括 Fable 5 在内的其他模型同样未能解决。
下图是 Fable 5.1 在各项基准测试中的对比情况:
![]()
Fable 5.1 在启用其生产安全防护措施的情况下进行了评估。在这些安全防护措施介入的任务中,Fable 5.1 和 Fable 5 在 OSWorld 2.0 测试中得分均为零,Fable 5 在 AutomationBench 测试中得分也为零。在所有其他安全防护措施介入的情况下,网络安全任务由 Claude Opus 4.8 完成,生物学任务由 Claude Opus 5 完成。这很可能导致 Fable 5.1 和 Fable 5 在这些基准测试中的性能下降。
Fable 5.1 分析了外部供应商提供的程序库,将反汇编结果与核心转储文件进行比对,最终把问题定位到该外部程序库中的一个缺陷。
这个案例当然来自 Anthropic 的早期合作伙伴,不能代替独立测试,但它说明了 Fable 5.1 试图建立的差异:不是更快地生成更多代码,而是能否像高级工程师一样,在复杂系统中逐层排除假设,最终找到真正的故障来源。
外部代码评审平台 CodeRabbit 的测试提供了相对冷静的观察。
在 45 项评审任务、105 个已知问题点上,Fable 5.1 找出了 64 个,Fable 5 找出 65 个,两者召回率几乎没有变化。但 Fable 5.1 最终生成的评论从 253 条减少到 166 条,琐碎意见从 265 条降至 79 条,精确率则由 32.8% 升至 37.3%。
![]()
也就是说,它没有发现更多问题,却减少了大量无效和挑剔式评论,输出变得更克制。
代价是速度。Fable 5.1 完成一次评审平均需要 18 分 38 秒,Fable 5 为 12 分 32 秒,耗时增加接近 49%。而且在这组测试中,提高推理强度并未带来更好结果:High 模式比 Low 模式更慢,召回率反而更低。
这意味着 Fable 5.1 并不是适用于所有编程任务的默认选择。对于日常、小规模的 Pull Request,它可能过于昂贵和缓慢;但面对跨越多个文件、需要理解整个代码库的复杂任务时,更长的分析过程才可能体现价值。
单价没有下降,Agent 为什么能便宜 45%?
Fable 5.1 的标准 API 价格并没有变化,仍为每百万输入 Token 10 美元、每百万输出 Token 50 美元。
真正发生大幅调整的是提示缓存读取价格:从每百万 Token 1 美元下降至 0.25 美元,降幅达到 75%。
Anthropic 估算,普通工作负载的综合成本将比 Fable 5 低约 25%;对于高度 Agent 化的任务,成本降幅最高约 45%。
![]()
缓存价格之所以重要,是因为 Agent 的成本结构与一次性聊天完全不同。
一个长时间工作的编程 Agent,可能反复读取同一套代码、系统提示、工具定义、项目规范和任务历史。如果每一次工具调用都重新按照标准输入价格计算,任务运行得越久,重复上下文带来的成本就越高。
提示缓存则允许系统保存已经处理过的上下文,后续只支付较低的读取费用。对于需要调用工具数十次、连续工作数小时的 Agent 而言,缓存读取可能占据输入量的大部分。
因此,Fable 5.1 此次价格调整并不是普遍降价,而是针对 Agent 工作负载进行的定向改造。
这也解释了为什么 Cognition 决定在 Devin 中,将部分原本交给 Opus 5 的流量迁移至 Fable 5.1。此前,Fable 级模型虽然能力更高,但很难在代码评审等高频任务中证明经济性;缓存降价后,企业衡量的已经不再是单个 Token 的价格,而是完成一次任务所需的总成本。
模型竞争由此开始从“每百万 Token 多少钱”,转向“完成一个合格任务多少钱”。
真正的大招,可能不是编程,而是科学研究
如果只看 Claude Code,Fable 5.1 很容易被理解成又一次编程模型升级。但 Anthropic 在这次发布中用了相当大的篇幅展示科学研究能力。
在分子设计实验中,Anthropic 让 Mythos 5.1 调用开源蛋白质设计和折叠工具,生成蛋白质结合剂,再将结果交给两家外部机构进行实验验证。
官方数据显示,在三个靶点上,Mythos 5.1 设计的结合剂亲和力,比 Adaptyv Bio 蛋白质设计竞赛中的最佳方案高出 10 倍;在 12 个靶点上的有效结合剂命中率接近 50%,而 Anthropic 给出的行业典型水平为 10% 至 15%。
在另一个项目中,Fable 5.1 使用 30 多年前 NASA 麦哲伦号探测器采集的雷达数据,训练神经网络,重新绘制了约三分之一金星表面的高分辨率高程图。
此前的地图只能呈现约 10 至 20 公里尺度的细节,新地图将分辨能力提高至 2 至 3 公里,并将高程测量准确度提高最多 25%。Anthropic 已经以 Creative Commons 许可公开这份地图,希望它能为 NASA VERITAS 和欧洲航天局 EnVision 任务选择观测目标提供参考。
Mythos 5.1 还为七个开源蛋白质和基因组深度学习模型编写了定制 GPU Kernel,并缓存中间结果,在保持输出完全相同的情况下,将推理速度最高提高 2.5 倍。在部分全基因组分析任务中,预计可减少 30% 至 60% 的 GPU 成本。
这些案例与普通问答最大的不同,是模型的输出已经离开文本环境,开始接受真实世界验证:蛋白质必须在实验室中真正结合,GPU Kernel 必须产生完全一致的结果,金星地图也需要与现有观测资料交叉验证。
当然,这距离“AI 独立完成科学发现”还有很远。模型使用的是人类提供的开源工具、数据、评价方法和实验验证体系,最终结论仍需要科学家审核。
但角色变化已经很明显:模型不再只负责搜索论文和总结知识,而是开始进入“提出方案—调用工具—运行计算—生成候选结果—接受实验验证”的研究闭环。
![]()
数据到底留不留?Anthropic 换了一种解法
Fable 5 此前默认要求保留 30 天使用数据,以便 Anthropic 跨时间、跨账号识别模型滥用。这项政策对安全监测有帮助,却成为金融、医疗、法律等受监管行业采用模型的障碍。
Fable 5.1 同时推出 Enterprise Frontier Safeguards,试图在安全监测和零数据留存之间找到折中方案。
在这一架构下,日志保存在客户自己的 AWS、Azure 或 Google Cloud 环境中,使用客户管理的密钥、访问策略和审计系统。Anthropic 提供自动化风险检测,但风险标记直接交给客户,默认不需要 Anthropic 员工进行人工查看。
从技术上说,数据仍然被保留一段时间,以便识别跨会话、跨账号发生的异常行为;但数据的实际控制权和人工审查权留在企业手中。
Anthropic 称,这套系统与 100 多家企业共同设计,参与者覆盖金融、医疗、制造、通信、法律、零售和公共部门,并包括多家美国系统重要性银行。
这可能是 Fable 5.1 比跑分更具现实意义的一项变化。
当 Agent 只能回答问题时,30 天数据留存或许只是隐私条款中的一行文字;当 Agent 开始接触代码仓库、财务资料、客户信息和生产系统凭证时,数据存放在哪里、谁能查看、如何审计,就会直接决定模型能否部署。
Fable 5.1 真正争夺的是“高价值任务”
Fable 5.1 并没有试图成为最便宜、最快的通用模型。
每百万输出 Token 50 美元的定价,决定了它很难被用于大量低价值问答。CodeRabbit 的测试也说明,它在复杂任务上愿意花更长时间,并不适合作为所有代码评审的默认模型。
Anthropic 争夺的是另一类市场:一次任务可能运行数小时,涉及多个应用、文件和工具,人工完成需要数天甚至数周,但任务本身又足够昂贵,能够覆盖模型费用。
软件故障根因分析、复杂合同修改、金融研究、跨代码库重构、科研计算和长时间浏览器操作,都属于这一范围。
因此,Fable 5.1 最重要的变化,是 Anthropic 正在同时补齐三块长期被忽视的基础设施:让缓存价格适合长任务,让安全系统减少误伤,让敏感数据留在客户控制的环境中。
这是一场从“模型能力”走向“模型可部署性”的竞争。
https://www.anthropic.com/claude-fable-and-mythos-5-1
https://www.coderabbit.ai/blog/fable-5-1-model-review
声明:本文为 InfoQ 整理,不代表平台观点,也不构成投资建议,未经许可禁止转载。
会议推荐
QCon 全球软件开发大会·2026(上海站)现已正式启动。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.