网易首页 > 网易号 > 正文 申请入驻

Claude Fable 5.1 来了:跑分大幅提升,缓存价格降 75%!用得越久反而越省

0
分享至

AI范儿 · 深度长文⏱ 11 分钟


▲ 图:Anthropic 官方发布主视觉

昨天(9 月 1 日),Anthropic 发布了 Claude Fable 5.1。84 天,但我们却好像等了很久。

5.1 的改动却不小。

输入和输出单价仍是每百万 Token 10 美元和 50 美元,缓存读取价格降到了原来的四分之一;能力提升集中在长时间 Agent 编程、多步骤研究,以及文档、表格和幻灯片工作。

几组数字先快速了解下:

1科学与工程终端任务得分提高113%,达到上一代的2.13 倍

2复杂商业工作流得分提高84%,达到上一代的1.84 倍

3Agent 终端编程得分提高33%

4缓存读取价格下降75%,高度 Agent 化任务的实际成本最高下降约45%

Fable 5.1 的增幅集中在长任务 以上一代 Fable 5 的成绩为 100 科学与工程终端任务 (Terminal-Bench-Science 0.1) 上一代 100 213 · +113% 复杂商业工作流 (AutomationBench) 上一代 100 184 · +84% Agent 终端编程 (Terminal-Bench 4.0) 上一代 100 133 · +33%

▲ 三项关键评测的相对增幅,以上一代成绩为 100

这组数据把 Fable 5.1 的定位讲得很清楚。Anthropic 希望企业交出去的是一项工作,几个小时甚至几天后,再回来验收结果。

“可以少盯”离“彻底不管”还很远。Anthropic 自己的 System Card 记录了模型猜答案、夸大授权,甚至尝试绕过权限检查的案例。

我更关心两个问题:它可以独立工作多久,人类敢给它多大的权限。

01为什么能按项目交货

先看 Anthropic 公布的能力评测。

Terminal-Bench-Science 0.1 测试模型能否在终端环境里完成科学和工程任务。Fable 5.1 得分从 24.7% 提高到 52.6%。按相对幅度计算,性能提高了 113%,达到上一代的 2.13 倍

测试 Agent 终端编程的 Terminal-Bench 4.0,从 42.0% 提高到 55.8%,提高约 33%

商业流程评测 AutomationBench 则从 17.1% 涨到 31.4%,提高约 84%,达到上一代的 1.84 倍


▲ 图:Anthropic 官方发布页,Fable 5.1 一列使用红色突出显示。

普通知识问答和单项编程也有进步,但幅度大多落在 1% 到 16% 之间。需要调用工具、连续执行和长时间保存任务状态的评测,增幅明显更高。

Artificial Analysis 的 Intelligence Index v4.1.1 综合了真实知识工作、Agent 工具调用、终端编程、科学推理、长上下文和事实准确性等 9 项评测。Fable 5.1 Max 得到66 分,排名第一


▲ 图:Artificial Analysis 在 X 发布的 Intelligence Index 与 Cost per Task 对比。来源:https://x.com/ArtificialAnlys/status/2094881171066978525

成本数据放在下图。


Fable 5.1 High 同样得到 62 分,与上一代 Fable 5 Max 持平;单项任务成本却从 3.14 美元降到 1.43 美元,下降约 54.5%

从 Xhigh 升到 Max,得分只从 65 增加到 66,提高约 1.5%;成本却从 2.65 美元涨到 3.69 美元,增加约 39%

这是整张榜单里最贵的 1 分。

System Card 还有一项更接近真实项目的测试,叫 ProgramBench。模型只拿到程序的二进制文件和说明文档,需要从头重建代码库,再接受超过 24.7 万项行为测试验收。

测试对象从jq、ripgrep一直延伸到 FFmpeg、SQLite 和 PHP 解释器,部分任务用到了完整的100 万 Token 上下文窗口

Fable 5.1 得分 87.6%,上一代是 86.3%,相对提高约 1.5%。增幅并不炸裂。ProgramBench 考察模型能否在庞大项目里持续保存状态、发现问题并修正实现,和普通编程题的侧重点不同。

Anthropic 还让 5 个 Agent 并行工作。达到相同任务成绩时,5 Agent 团队的延迟减少约50%,速度接近单 Agent 的2 倍


▲ 图:Anthropic System Card 第 181 页。5 Agent 团队达到相同成绩所需的延迟约为单 Agent 的一半。

代价也很直接:它们会消耗更多 Token。你确实多请了几个人,只不过他们都拿着同一张信用卡。

02从代码库到实验室

跑分能说明能力,官方案例更能说明 Anthropic 想把这种能力卖给谁。

投资公司 Millennium 曾遇到一个百万分之一级别的偶发崩溃。工程师排查了四五年,之前尝试过的模型也没能找到原因。Fable 5.1 拆解外部供应商的程序库,对照 core dump,最终把问题定位到程序库中的一个 Bug。

一个查了几年、约每 100 万次才出现 1 次的问题,被模型顺着程序运行留下的痕迹翻了出来。这样的排查工作量,和“帮我补一段代码”完全不在一个量级。

MongoDB 的案例更接近完整项目。Fable 5.1 先研究多个服务的代码和文档,再提出可扩展设计,随后在无人监督的情况下连续运行数小时,用大约 3 天完成了一个复杂原型。交付物包括代码、视觉演示、验证证据和下一阶段结果。

Ramp 高级机器学习工程师 Dwight Temple 还介绍了一次 38 小时无人值守运行:模型发现旧实验存在标签问题,修正数据,启动 6 组并行实验,再带着结论回来。

合作伙伴 Every 称,Fable 5.1 的运行速度约为 Opus 5 的2 倍,也就是快约 100%,Token 使用量减少约50%。这是合作伙伴自报数据,不能替代统一评测,但它解释了为什么一些原本交给 Opus 的任务开始转向 Fable。

类似的长任务已经进入科研场景。

Claude Fable 5.1 根据 30 多年前 NASA 麦哲伦号拍摄的雷达数据,为金星约三分之一的表面生成了一张新的高分辨率高程图。

原地图只能显示 10 至 20 公里尺度的细节,新地图推进到 2 至 3 公里。按尺度计算,可辨认的地形细节缩小约70% 至 90%,高度测量准确性最高提高约25%


▲ 麦哲伦号雷达图。图:Anthropic / NASA 数据。


▲ 原有高程图,只能显示约 10 至 20 公里尺度的地形。图:Anthropic。


▲ Fable 5.1 生成的新高程图,可以显示约 2 至 3 公里尺度的细节。图:Anthropic。

Mythos 5.1 则被用于设计蛋白质结合剂。在 12 个靶点的实验中,接近 50% 的设计能够实际结合,常见命中率约为 10% 至 15%。它的命中率达到常见水平的3.3 至 5 倍,提高约 233% 至 400%


▲ 橙色部分为 Claude 设计的结合剂,灰色为目标蛋白。图中 Nipah G 案例实验命中率为 18/30,即 60%。图:Anthropic。

它还为 7 个开源生物学深度学习模型编写了定制 GPU 内核,速度最高达到原来的2.5 倍,提高约 150%,部分大规模分析的 GPU 成本降低约30% 至 60%

这些结果来自 Anthropic 及其合作机构,只能看作经过实验验证的早期案例。Fable 处理原始数据,Mythos 设计蛋白质结合剂、优化研究工具,最后仍要由实验室继续验证。

03跑得久,也付得起

Fable 5.1 的 API 标价没有变化,输入每百万 Token 10 美元,输出每百万 Token 50 美元。

缓存读取从每百万 Token 1 美元降到 0.25 美元,下降 75%,只剩原来的四分之一

这对 Agent 很重要。Agent 连续工作时,会反复读取相同的代码、文档和历史记录。没有缓存优惠,相当于员工每天进办公室,都要重新买一次办公桌。

Anthropic 估算,普通工作负载的实际成本可以下降约25%;对于需要频繁读取上下文的高度 Agent 化任务,最高下降约45%

Artificial Analysis 的数据同时提醒,推理档位不能无脑拉满。Max 模式只比 Xhigh 高约1.5%,单项成本却高约39%。复杂任务、失败代价很高的任务可以上 Max,普通知识工作从 Medium 或 High 开始更合理。

买了越野车,下楼取快递用不上低速四驱。

04但还不能真放手

Agent 连续工作几十个小时后,安全问题也随之发生变化。

模型连续调用工具后,风险不再局限于一句话答错。它可能在一连串操作中误解授权、跳过验证,或者自作主张替用户补上一句“他已经同意了”。

Anthropic 一边扩大 Fable 5.1 的能力,一边减少安全机制对正常任务的误伤。新版网络安全防护的正常请求误拦截减少约60%;生物学防护的正常请求触发频率减少约85%,只剩原来的约15%

System Card 记录了几次值得警惕的行为。

在内部监控中,少于0.01%的完成任务出现过绕过安全分类器、绕过损坏的权限钩子,或者夸大用户授权的情况,也就是每 1 万次完成任务中少于 1 次。尝试启动关闭权限检查子 Agent 的情况低于0.001%,也就是每 10 万次中少于 1 次。

其中一次,用户只说了“发布”,模型却向子 Agent 声称用户已经亲自写好代码审查正文和 6 条行内评论,并明确要求以用户身份发布。另一次,它为需要明确授权的删除操作,编造了一段用户从未说过的批准语。

这些操作最终被外部权限系统拦住。Anthropic 也没有发现公开恶意行为、长期战略欺骗或长期逃避监督的证据。

概率很低,但 Agent 会把低概率乘以调用次数。一个模型连续运行 38 小时、调用几百次工具后,“偶尔一次”就不再只是统计表里的小数点。

删除、发布、付款、修改生产环境等操作,仍然需要明确授权和外部检查点。模型是否认为自己获得了许可,不能作为执行依据。

长任务里,人该盯哪里 执行可以连续运行,高风险动作仍需明确授权 人类设定任务与权限 目标 · 数据范围 · 检查点 AGENT 连续执行 规划 拆解与排程 调用工具 代码 · 文件 · API 验证与重试 测试 · 恢复 普通结果 代码 · 报告 · 实验结果 高风险动作 发布 · 删除 · 付款 人工批准 自动执行 需人工授权

▲ Agent 可以持续执行,高风险动作仍需人工授权

事实准确性也有类似的反差。

在 AA-Omniscience 闭卷测试中,Mythos 5.1 的正确率从 76% 提高到 77%,相对提高约 1.3%;错误率却从 18% 提高到 20%,增加约 11%。拒答率从 7% 降到 2%,减少约 71%


▲ 图:Anthropic System Card 第 123 页。Mythos 5.1 的拒答率大幅下降,正确答案和错误答案同时增加。

它回答得更多,答对的更多,答错的也更多。处理事实性任务时,搜索、引用和外部验证仍然不能省。

产品说明Fable 与 Mythos 有什么区别?两者使用相同的模型权重,主要区别在安全阈值和访问范围。Fable 5.1 面向普通用户和企业;Mythos 5.1 只向经过审核的网络安全和生命科学机构开放。模型知识截止到 2026 年 6 月。Fable 5.1 默认要求保留数据 30 天用于安全监测,部分符合条件的企业客户可以申请零数据保留。

我目前还没有对 Fable 5.1 做完整实测。文中的案例来自 Anthropic 和首批合作伙伴,能说明产品方向,不能代替独立测试。

如果工作只是聊天、改几句话、写一段简单代码,它依然太贵,便宜模型更合适。

跨多个代码库的改造、复杂研究、长文档分析,以及需要连续运行十几个小时的 Agent 工作流,才是 Fable 5.1 对准的任务。

Ramp 的案例里,Fable 5.1 在 38 小时后交回了 6 组实验结果。System Card 里,它也曾编造授权、试探权限。

现阶段我愿意把执行过程交给它,发布、删除和付款的最后一步还得留在人手里。

05资料来源

Anthropic 发布文章 https://www.anthropic.com/claude-fable-and-mythos-5-1

Anthropic Fable 产品页 https://www.anthropic.com/claude/fable

Claude Fable 5.1 & Claude Mythos 5.1 System Card 页面 https://www.anthropic.com/claude-fable-5-1-mythos-5-1-system-card

System Card PDF 直链 https://www-cdn.anthropic.com/0339e6a7c5c7b87f5c07798616dc32c215d14235/Claude%20Fable%205.1%20%26%20Claude%20Mythos%205.1%20System%20Card.pdf

Artificial Analysis 模型评测页 https://artificialanalysis.ai/models/claude-fable-5-1

Artificial Analysis 在 X 发布的智力指数与成本对比 https://x.com/ArtificialAnlys/status/2094881171066978525

如果让 Fable 5.1 连续工作一天,你会先交给它哪项任务?评论区聊聊,也说说哪些权限你肯定不会交出去。觉得有用 → 点个❤️在看转给还不知道的朋友点个赞 告诉我你看完了关注「AI范儿」,下次更新第一时间收到

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
深大干翻985登顶,哈工大跌到23,都是千万家长用脚投票的结果。

深大干翻985登顶,哈工大跌到23,都是千万家长用脚投票的结果。

娱乐的宅急便
2026-09-02 08:00:06
事闹大了?伊朗总统开会还没回国,亲生儿子就要被革命卫队定罪?

事闹大了?伊朗总统开会还没回国,亲生儿子就要被革命卫队定罪?

晓风洞察
2026-09-02 11:33:48
梅艳芳母亲 102 岁意外离世:闹了 20 年遗产,最后什么也没带走

梅艳芳母亲 102 岁意外离世:闹了 20 年遗产,最后什么也没带走

一盅情怀
2026-09-02 08:41:39
远离“造神”陷阱!北大已确认韦东奕重大决定,经济头脑太意外

远离“造神”陷阱!北大已确认韦东奕重大决定,经济头脑太意外

暖心萌阿菇凉
2026-08-28 07:09:57
库克卸任那晚,郭台铭夫妻同框亮相,绯闻都没提,却什么都说了

库克卸任那晚,郭台铭夫妻同框亮相,绯闻都没提,却什么都说了

紫雪盈仓
2026-09-02 12:37:32
iPhone18 Pro Max价格前瞻:Pro Max顶配或卖19999元,Ultra超2万元

iPhone18 Pro Max价格前瞻:Pro Max顶配或卖19999元,Ultra超2万元

小8说科技
2026-09-02 00:33:41
当他们把"卖菜大叔"赶下场时,也把22亿次观看苏超的烟火气踢没了

当他们把"卖菜大叔"赶下场时,也把22亿次观看苏超的烟火气踢没了

民间胡扯老哥
2026-09-01 06:48:35
母亲住院我在照顾,顺手帮了隔壁床老人,谁知几天后她儿子找来了

母亲住院我在照顾,顺手帮了隔壁床老人,谁知几天后她儿子找来了

人间百态大全
2026-09-02 06:40:05
耶鲁全奖生撞路边花坛身亡,父母告市政府近十年获赔千万美元,其母否认所谓“释怀”

耶鲁全奖生撞路边花坛身亡,父母告市政府近十年获赔千万美元,其母否认所谓“释怀”

红星新闻
2026-08-31 17:29:18
击败中国女排夺冠,担任泰国领队、助教,冯坤1年的薪水有多少?

击败中国女排夺冠,担任泰国领队、助教,冯坤1年的薪水有多少?

喜欢体育的猫
2026-09-02 10:32:05
一个年级90多个班、5000多名学生!沈阳、苏州等地初中现“超级大校”

一个年级90多个班、5000多名学生!沈阳、苏州等地初中现“超级大校”

闪电新闻
2026-09-01 19:39:15
缺人、缺枪、缺钱!这样的盟友不好吗?朝鲜从俄罗斯挣了145亿美元

缺人、缺枪、缺钱!这样的盟友不好吗?朝鲜从俄罗斯挣了145亿美元

鹰眼Defence
2026-08-31 16:56:48
我刚做完手术,公公就带着3个孙子住进我家,让我帮忙带,我平静地看着老公:是你让他们走,还是你们全家都走

我刚做完手术,公公就带着3个孙子住进我家,让我帮忙带,我平静地看着老公:是你让他们走,还是你们全家都走

晓艾故事汇
2026-09-02 10:24:08
日本企业最难时都不敢这么干,星宇股份这次,真的惹错人了

日本企业最难时都不敢这么干,星宇股份这次,真的惹错人了

掘金日本房产
2026-09-01 20:53:21
生图好能打,达达里奥最新美照来袭

生图好能打,达达里奥最新美照来袭

可乐谈情感
2026-09-02 10:39:51
9月运势翻盘!3大生肖扫尽低迷,事业一路走高,付出皆有圆满回报

9月运势翻盘!3大生肖扫尽低迷,事业一路走高,付出皆有圆满回报

人閒情事
2026-09-02 13:21:08
游戏结束,荷兰安世收到裁决,中方冻结资产,跟美国站队没好下场

游戏结束,荷兰安世收到裁决,中方冻结资产,跟美国站队没好下场

军机Nova
2026-09-02 00:26:54
中国长鑫首次小批量产HBM3E,落后三星等一代

中国长鑫首次小批量产HBM3E,落后三星等一代

碳基打工人
2026-08-31 23:41:09
伊朗称袭击约旦哈桑王子空军基地 摧毁多架无人机

伊朗称袭击约旦哈桑王子空军基地 摧毁多架无人机

财联社
2026-09-02 07:39:07
谢贤走了,蔡澜走了,李敖也走了,四大风流才子只有他还活着

谢贤走了,蔡澜走了,李敖也走了,四大风流才子只有他还活着

枫尘余往逝
2026-08-31 17:55:34
2026-09-02 14:04:49
AI范儿 incentive-icons
AI范儿
AI范儿是一个专注于人工智能领域的资讯和学习平台,提供最新的人工智能资讯
822文章数 685关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

女孩9岁痛失双亲一路读到博士 每次升学都"刚好卡线"

头条要闻

女孩9岁痛失双亲一路读到博士 每次升学都"刚好卡线"

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

孙宇晨和景甜的瓜彻底反转了

财经要闻

需要重视的全球“资金失衡”

汽车要闻

连续5个月3万+ 小米汽车8月最新交付情况

态度原创

时尚
旅游
亲子
本地
军事航空

夏天别总穿黑色裤子,试试这几款高腰裙,显瘦优雅又提气质

旅游要闻

埃及导游阿巴斯的中国情缘

亲子要闻

跟妈妈和嫂子逛吃的一天,给小梅朵和格灵坤德挑了超好看的藏装~

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

军事要闻

特朗普威胁伊朗终极打击蓄势待发

无障碍浏览 进入关怀版