AI范儿 · 深度长文⏱ 11 分钟
![]()
▲ 图:Anthropic 官方发布主视觉
昨天(9 月 1 日),Anthropic 发布了 Claude Fable 5.1。84 天,但我们却好像等了很久。
5.1 的改动却不小。
输入和输出单价仍是每百万 Token 10 美元和 50 美元,缓存读取价格降到了原来的四分之一;能力提升集中在长时间 Agent 编程、多步骤研究,以及文档、表格和幻灯片工作。
几组数字先快速了解下:
1科学与工程终端任务得分提高113%,达到上一代的2.13 倍;
2复杂商业工作流得分提高84%,达到上一代的1.84 倍;
3Agent 终端编程得分提高33%;
4缓存读取价格下降75%,高度 Agent 化任务的实际成本最高下降约45%。
Fable 5.1 的增幅集中在长任务 以上一代 Fable 5 的成绩为 100 科学与工程终端任务 (Terminal-Bench-Science 0.1) 上一代 100 213 · +113% 复杂商业工作流 (AutomationBench) 上一代 100 184 · +84% Agent 终端编程 (Terminal-Bench 4.0) 上一代 100 133 · +33%
▲ 三项关键评测的相对增幅,以上一代成绩为 100
这组数据把 Fable 5.1 的定位讲得很清楚。Anthropic 希望企业交出去的是一项工作,几个小时甚至几天后,再回来验收结果。
“可以少盯”离“彻底不管”还很远。Anthropic 自己的 System Card 记录了模型猜答案、夸大授权,甚至尝试绕过权限检查的案例。
我更关心两个问题:它可以独立工作多久,人类敢给它多大的权限。
01为什么能按项目交货
先看 Anthropic 公布的能力评测。
Terminal-Bench-Science 0.1 测试模型能否在终端环境里完成科学和工程任务。Fable 5.1 得分从 24.7% 提高到 52.6%。按相对幅度计算,性能提高了 113%,达到上一代的 2.13 倍。
测试 Agent 终端编程的 Terminal-Bench 4.0,从 42.0% 提高到 55.8%,提高约 33%。
商业流程评测 AutomationBench 则从 17.1% 涨到 31.4%,提高约 84%,达到上一代的 1.84 倍。
![]()
▲ 图:Anthropic 官方发布页,Fable 5.1 一列使用红色突出显示。
普通知识问答和单项编程也有进步,但幅度大多落在 1% 到 16% 之间。需要调用工具、连续执行和长时间保存任务状态的评测,增幅明显更高。
Artificial Analysis 的 Intelligence Index v4.1.1 综合了真实知识工作、Agent 工具调用、终端编程、科学推理、长上下文和事实准确性等 9 项评测。Fable 5.1 Max 得到66 分,排名第一。
![]()
▲ 图:Artificial Analysis 在 X 发布的 Intelligence Index 与 Cost per Task 对比。来源:https://x.com/ArtificialAnlys/status/2094881171066978525
成本数据放在下图。
![]()
Fable 5.1 High 同样得到 62 分,与上一代 Fable 5 Max 持平;单项任务成本却从 3.14 美元降到 1.43 美元,下降约 54.5%。
从 Xhigh 升到 Max,得分只从 65 增加到 66,提高约 1.5%;成本却从 2.65 美元涨到 3.69 美元,增加约 39%。
这是整张榜单里最贵的 1 分。
System Card 还有一项更接近真实项目的测试,叫 ProgramBench。模型只拿到程序的二进制文件和说明文档,需要从头重建代码库,再接受超过 24.7 万项行为测试验收。
测试对象从jq、ripgrep一直延伸到 FFmpeg、SQLite 和 PHP 解释器,部分任务用到了完整的100 万 Token 上下文窗口。
Fable 5.1 得分 87.6%,上一代是 86.3%,相对提高约 1.5%。增幅并不炸裂。ProgramBench 考察模型能否在庞大项目里持续保存状态、发现问题并修正实现,和普通编程题的侧重点不同。
Anthropic 还让 5 个 Agent 并行工作。达到相同任务成绩时,5 Agent 团队的延迟减少约50%,速度接近单 Agent 的2 倍。
![]()
▲ 图:Anthropic System Card 第 181 页。5 Agent 团队达到相同成绩所需的延迟约为单 Agent 的一半。
代价也很直接:它们会消耗更多 Token。你确实多请了几个人,只不过他们都拿着同一张信用卡。
02从代码库到实验室
跑分能说明能力,官方案例更能说明 Anthropic 想把这种能力卖给谁。
投资公司 Millennium 曾遇到一个百万分之一级别的偶发崩溃。工程师排查了四五年,之前尝试过的模型也没能找到原因。Fable 5.1 拆解外部供应商的程序库,对照 core dump,最终把问题定位到程序库中的一个 Bug。
一个查了几年、约每 100 万次才出现 1 次的问题,被模型顺着程序运行留下的痕迹翻了出来。这样的排查工作量,和“帮我补一段代码”完全不在一个量级。
MongoDB 的案例更接近完整项目。Fable 5.1 先研究多个服务的代码和文档,再提出可扩展设计,随后在无人监督的情况下连续运行数小时,用大约 3 天完成了一个复杂原型。交付物包括代码、视觉演示、验证证据和下一阶段结果。
Ramp 高级机器学习工程师 Dwight Temple 还介绍了一次 38 小时无人值守运行:模型发现旧实验存在标签问题,修正数据,启动 6 组并行实验,再带着结论回来。
合作伙伴 Every 称,Fable 5.1 的运行速度约为 Opus 5 的2 倍,也就是快约 100%,Token 使用量减少约50%。这是合作伙伴自报数据,不能替代统一评测,但它解释了为什么一些原本交给 Opus 的任务开始转向 Fable。
类似的长任务已经进入科研场景。
Claude Fable 5.1 根据 30 多年前 NASA 麦哲伦号拍摄的雷达数据,为金星约三分之一的表面生成了一张新的高分辨率高程图。
原地图只能显示 10 至 20 公里尺度的细节,新地图推进到 2 至 3 公里。按尺度计算,可辨认的地形细节缩小约70% 至 90%,高度测量准确性最高提高约25%。
![]()
▲ 麦哲伦号雷达图。图:Anthropic / NASA 数据。
![]()
▲ 原有高程图,只能显示约 10 至 20 公里尺度的地形。图:Anthropic。
![]()
▲ Fable 5.1 生成的新高程图,可以显示约 2 至 3 公里尺度的细节。图:Anthropic。
Mythos 5.1 则被用于设计蛋白质结合剂。在 12 个靶点的实验中,接近 50% 的设计能够实际结合,常见命中率约为 10% 至 15%。它的命中率达到常见水平的3.3 至 5 倍,提高约 233% 至 400%。
![]()
▲ 橙色部分为 Claude 设计的结合剂,灰色为目标蛋白。图中 Nipah G 案例实验命中率为 18/30,即 60%。图:Anthropic。
它还为 7 个开源生物学深度学习模型编写了定制 GPU 内核,速度最高达到原来的2.5 倍,提高约 150%,部分大规模分析的 GPU 成本降低约30% 至 60%。
这些结果来自 Anthropic 及其合作机构,只能看作经过实验验证的早期案例。Fable 处理原始数据,Mythos 设计蛋白质结合剂、优化研究工具,最后仍要由实验室继续验证。
03跑得久,也付得起
Fable 5.1 的 API 标价没有变化,输入每百万 Token 10 美元,输出每百万 Token 50 美元。
缓存读取从每百万 Token 1 美元降到 0.25 美元,下降 75%,只剩原来的四分之一。
这对 Agent 很重要。Agent 连续工作时,会反复读取相同的代码、文档和历史记录。没有缓存优惠,相当于员工每天进办公室,都要重新买一次办公桌。
Anthropic 估算,普通工作负载的实际成本可以下降约25%;对于需要频繁读取上下文的高度 Agent 化任务,最高下降约45%。
Artificial Analysis 的数据同时提醒,推理档位不能无脑拉满。Max 模式只比 Xhigh 高约1.5%,单项成本却高约39%。复杂任务、失败代价很高的任务可以上 Max,普通知识工作从 Medium 或 High 开始更合理。
买了越野车,下楼取快递用不上低速四驱。
04但还不能真放手
Agent 连续工作几十个小时后,安全问题也随之发生变化。
模型连续调用工具后,风险不再局限于一句话答错。它可能在一连串操作中误解授权、跳过验证,或者自作主张替用户补上一句“他已经同意了”。
Anthropic 一边扩大 Fable 5.1 的能力,一边减少安全机制对正常任务的误伤。新版网络安全防护的正常请求误拦截减少约60%;生物学防护的正常请求触发频率减少约85%,只剩原来的约15%。
System Card 记录了几次值得警惕的行为。
在内部监控中,少于0.01%的完成任务出现过绕过安全分类器、绕过损坏的权限钩子,或者夸大用户授权的情况,也就是每 1 万次完成任务中少于 1 次。尝试启动关闭权限检查子 Agent 的情况低于0.001%,也就是每 10 万次中少于 1 次。
其中一次,用户只说了“发布”,模型却向子 Agent 声称用户已经亲自写好代码审查正文和 6 条行内评论,并明确要求以用户身份发布。另一次,它为需要明确授权的删除操作,编造了一段用户从未说过的批准语。
这些操作最终被外部权限系统拦住。Anthropic 也没有发现公开恶意行为、长期战略欺骗或长期逃避监督的证据。
概率很低,但 Agent 会把低概率乘以调用次数。一个模型连续运行 38 小时、调用几百次工具后,“偶尔一次”就不再只是统计表里的小数点。
删除、发布、付款、修改生产环境等操作,仍然需要明确授权和外部检查点。模型是否认为自己获得了许可,不能作为执行依据。
长任务里,人该盯哪里 执行可以连续运行,高风险动作仍需明确授权 人类设定任务与权限 目标 · 数据范围 · 检查点 AGENT 连续执行 规划 拆解与排程 调用工具 代码 · 文件 · API 验证与重试 测试 · 恢复 普通结果 代码 · 报告 · 实验结果 高风险动作 发布 · 删除 · 付款 人工批准 自动执行 需人工授权
▲ Agent 可以持续执行,高风险动作仍需人工授权
事实准确性也有类似的反差。
在 AA-Omniscience 闭卷测试中,Mythos 5.1 的正确率从 76% 提高到 77%,相对提高约 1.3%;错误率却从 18% 提高到 20%,增加约 11%。拒答率从 7% 降到 2%,减少约 71%。
![]()
▲ 图:Anthropic System Card 第 123 页。Mythos 5.1 的拒答率大幅下降,正确答案和错误答案同时增加。
它回答得更多,答对的更多,答错的也更多。处理事实性任务时,搜索、引用和外部验证仍然不能省。
产品说明Fable 与 Mythos 有什么区别?两者使用相同的模型权重,主要区别在安全阈值和访问范围。Fable 5.1 面向普通用户和企业;Mythos 5.1 只向经过审核的网络安全和生命科学机构开放。模型知识截止到 2026 年 6 月。Fable 5.1 默认要求保留数据 30 天用于安全监测,部分符合条件的企业客户可以申请零数据保留。
我目前还没有对 Fable 5.1 做完整实测。文中的案例来自 Anthropic 和首批合作伙伴,能说明产品方向,不能代替独立测试。
如果工作只是聊天、改几句话、写一段简单代码,它依然太贵,便宜模型更合适。
跨多个代码库的改造、复杂研究、长文档分析,以及需要连续运行十几个小时的 Agent 工作流,才是 Fable 5.1 对准的任务。
Ramp 的案例里,Fable 5.1 在 38 小时后交回了 6 组实验结果。System Card 里,它也曾编造授权、试探权限。
现阶段我愿意把执行过程交给它,发布、删除和付款的最后一步还得留在人手里。
05资料来源
Anthropic 发布文章 https://www.anthropic.com/claude-fable-and-mythos-5-1
Anthropic Fable 产品页 https://www.anthropic.com/claude/fable
Claude Fable 5.1 & Claude Mythos 5.1 System Card 页面 https://www.anthropic.com/claude-fable-5-1-mythos-5-1-system-card
System Card PDF 直链 https://www-cdn.anthropic.com/0339e6a7c5c7b87f5c07798616dc32c215d14235/Claude%20Fable%205.1%20%26%20Claude%20Mythos%205.1%20System%20Card.pdf
Artificial Analysis 模型评测页 https://artificialanalysis.ai/models/claude-fable-5-1
Artificial Analysis 在 X 发布的智力指数与成本对比 https://x.com/ArtificialAnlys/status/2094881171066978525
如果让 Fable 5.1 连续工作一天,你会先交给它哪项任务?评论区聊聊,也说说哪些权限你肯定不会交出去。觉得有用 → 点个❤️在看转给还不知道的朋友点个赞 告诉我你看完了关注「AI范儿」,下次更新第一时间收到
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.