Fable 5.1 发布
今天 Fable 5.1 发布,要点如下:
各项 Bench 明显 Fable 5
![]()
上下文价格不变,输入 $10,输出 $50
缓存价格降低 75%,综合成本降低 25%(复杂任务降低 45%)
所有用户当前额度重置,50% 额外额度延续到 9月13日。更重要的是:现在所有额度恢复,且不影响重置,如下图:我原本 Fable 已经用完等重置了,今天给我重置一次,明天还有重置
![]()
下面让我按照官方发布的顺序节奏,给大家介绍下这个模型,跑分与图表都来自官方
模型价格
模型的输入和输出的价格与 Fable 5 一致,分别是每百万 token 10 美元和 50 美元。缓存价格大幅下调,降幅 75%,至每百万 token 0.25 美元
![]()
Fable 5 与 Fable 5.1 的成本指数对比
典型工作负载下,总成本比 Fable 5 低约 25%。高度智能体化的任务,最多能低 45%
缓存读取是模型重读已经处理过的上下文时产生的开销。单轮对话里这部分占比小,降价感受不明显
模型跑分
![]()
八项基准,Fable 5.1 全部排第一
Terminal-Bench-Science 0.1:Fable 5.1 得 52.6%,Fable 5 是 24.7%,Opus 5 是 29.0%,GPT-5.6 Sol 是 22.4%。Terminal-Bench 4.0 的智能体编码:Fable 5.1 得 55.8%,Mythos 5.1 在同一项上得 60.9%。知识工作 GDPval-AA v2:Fable 5.1 得 1853 分,Opus 5 是 1824 分
Humanity's Last Exam 不带工具 60.9%,带工具 65.0%。电脑操作 OSWorld 2.0 宽松判分 77.9%,严格判分 41.7%。AutomationBench 从 Fable 5 的 17.1% 升至 31.4%,是全表涨幅最大的一项。CursorBench 3.2.0 得 73.4%
这些分数是在生产环境 safeguard 开启的条件下跑出来的。被 safeguard 拦下的任务,在 OSWorld 上直接计零分。被拦截的网安任务由 Opus 4.8 补跑,生物任务由 Opus 5 补跑。Anthropic 认为这一设置可能压低了 Fable 5.1 和 Fable 5 的成绩
![]()
Terminal-Bench-Science 0.1,精度与成本
四张成本对精度的曲线图值得一看。同一个模型从 low 到 max 分五档思考预算,每档标出平均花费。Terminal-Bench-Science 上,Fable 5.1 的 low 档花 11 美元得 26 分,Fable 5 的 max 档花 44 美元得 24.7 分
成本低四倍,分数还高一点
![]()
Terminal-Bench 4.0,精度与成本
Terminal-Bench 4.0 上,Mythos 5.1 整条线在 Fable 5.1 上方,同样的花费多五到六分
![]()
Humanity's Last Exam,精度与成本
Humanity's Last Exam 分带工具和不带工具两组,共四条线。带工具的 Fable 5.1 花 0.5 美元就过 60 分,不带工具要花两倍以上
![]()
CursorBench 3.2.0,精度与成本
CursorBench 上两条线基本平行,Fable 5.1 整体左移
作为效果,Millennium 有一段代码大约每百万次运行崩溃一次,团队查了四五年没有结论。Fable 5.1 反汇编了外部供应商的库,与 core dump 比对,找到了库自身的缺陷
![]()
默认档位:Claude Code 里是 High,Claude Cowork 和 claude.ai 上是 Medium
科研 分子设计
许多现代药物通过与体内靶点结合来发挥作用,高亲和力结合物是药物低剂量起效的前提。Anthropic 给 Mythos 5.1 接入了开源的蛋白设计和折叠工具,将设计结果送往两家外部机构做实验验证
12 个靶点上,命中率接近 50%。当下蛋白设计领域的常规命中率在 10% 到 15%。其中三个靶点上,结合亲和力比 Adaptyv Bio 设计竞赛的最佳投稿高出 10 倍
计算分析与建模
Fable 5.1 训练了一个神经网络,为金星三分之一的表面重新生成了高程图
原始数据来自 NASA 麦哲伦号 30 多年前拍摄的雷达图像,以及一份只覆盖五分之一星球的旧地图
![]()
新图的分辨率从 10 至 20 公里缩小到 2 至 3 公里,高度精度最多提升 25%。这份数据已按 CC 协议在 Zenodo 上发布,赶在 NASA VERITAS 和 ESA EnVision 两个任务之前
计算生物学
生物学实验中常在 GPU 上运行特定的机器学习模型,这些模型的速度制约着研究进度。Mythos 5.1 为七个开源深度学习模型手写了 GPU kernel 并缓存了中间结果,最高提速 2.5 倍,输出完全一致
![]()
七个模型的推理提速倍数
![]()
全基因组分析的估算成本对比
生物学家做一次全基因组分析要调用这些模型上千次,比如测试每个人类基因附近的每一种突变。Enformer 的 GPU 费用从 3 万美元降到 2.1 万,Evo 2 从 1.8 万降到 8 千
这类优化通常需要一组性能工程师花几周完成,学术实验室往往负担不起。Mythos 5.1 用几天做完,只依据公开源码。Anthropic 称这批优化将会开源
此外,Anthropic 上周预告了 Model Hardware Standard,让 Claude 可以直接操作实验室设备。他们还扩大了 AI for Science 项目的规模,为高影响力科研项目提供免费额度,并推出了面向科学家的 Claude Team 优惠计划
安全
发布前,Anthropic 及外部研究者对两个模型做了多个领域的风险测试。以下是 System Card 的摘要
化生风险
测试内容包括专家红队、自动化评测,以及一场桌面推演(博士级生物学家与 AI 专家配对,检验模型能否追上人类专家)。Mythos 5.1 的能力强于 Mythos 5,但仍未触及 RSP 所定义的下一档风险线。因此 Mythos 5.1 沿用 Mythos 5 的 safeguard,研究型生物能力继续受限
网安风险
关闭 safeguard 后测试,Mythos 5.1 的网安能力超过此前所有已发布模型,但仍在 Anthropic 前沿合规框架的较低风险档内。Fable 5.1 的网安 safeguard 经过两家外部机构和 Gray Swan 的自动化压力测试,未发现关键级越狱
智能体安全
面对恶意的智能体编码和电脑操作请求,Mythos 5.1 的拒绝率与 Mythos 5、Sonnet 5、Opus 5 相当。在外部 prompt injection 基准上,它是 Anthropic 目前最稳健的模型
对齐
自动化行为审计的结论:Mythos 5.1 在多数指标上优于 Mythos 5。接到不可能完成的任务时,获取测试环境外资源的概率下降。用动机性推理自我辩护的概率下降。为达用户目标而无视显式约束的情况同样减少
训练数据回看显示,reward hacking 的尝试率和成功率均低于上一代
不足之处:测试中,模型仍偶尔绕过审批和自动模式分类器。审计在超长上下文和多 agent 场景中的可见度不够,不可能任务的覆盖也不足
误报下降
生物 safeguard 对基础生物与医学问题的误报率,比 Fable 5 上线时减少了 85%。生命科学的研发类查询仍转由 Opus 模型处理,专业用户需通过 Mythos 5.1 的准入程序获得访问
网安方面,Claude Code 用户平均每个会话被 safeguard 中断的次数减少 60%。Fable 5.1 现在允许用于发现软件漏洞,即防守方的工作。渗透测试、exploit 编写、二进制漏洞扫描仍转交 Opus 模型
企业方向推出了 EFS:Enterprise Frontier Safeguards,企业前沿安全机制。用户数据存储在客户自有的云基础设施上,不在 Anthropic 一侧,人工复核默认由客户自行完成。Anthropic 称这套机制与超过 100 家客户共同设计,覆盖金融、医疗、制造、电信、法律、零售和公共部门,云厂商方面 AWS、Google Cloud、Azure 均参与
EFS 今年秋天分批上线。在此之前,符合条件的客户可以零数据留存方式使用 Fable 5.1
还有一项针对蒸馏的改动。从今天起新建的 API 账号,无法手动修改多轮对话中 Claude 的历史上下文并同时保留其思维链记录。这是一条已被公开记录的蒸馏路径。已有账号暂不受影响,下一代模型发布时将对所有账号生效
Mythos 的准入
Mythos 5.1 与 Fable 5.1 是同一个模型,区别在于对通过审核的个人和机构放宽了网安与生命科学方面的 safeguard
目前有两个入口
网安走 CVP:Cyber Verification Program,网安验证计划,目前提供部分 Opus 和 Sonnet 级模型的低限制版本,近期将加入 Mythos 级
生命科学走 LSVP:Life Sciences Verification Program,生命科学验证计划,与美国政府合作设立,首批参与者已入驻
目前仅对一批美国机构开放。Anthropic 表示正与美国政府协调,尽快扩至更多国内和国际伙伴
另外,Claude Security(扫描代码库寻找漏洞、为人工复核提供补丁的产品)现已改由 Mythos 5.1 驱动
欧盟文字水印
今年 7 月,Anthropic 与另外 190 家签署方共同签署了欧盟 AI 法案的「AI 生成内容透明度行为准则」
按要求,8 月 2 日之后发布的模型,输出须携带水印,以数值方式判断一段文字由 Claude 参与撰写的概率。没有检测 API 的人看不到这个水印。它不影响输出质量,不含用户、机构和对话的任何信息
检测 API 目前为私有预览,按欧盟法律先向监管机构、执法部门、媒体、事实核查方、独立研究者、教育机构及欧盟公民社会组织开放,同样负有合规义务的企业亦可申请
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.