9月2日,人工智能公司Anthropic正式发布新一代旗舰大模型Claude Fable 5.1与Claude Mythos 5.1,Anthropic将这对“孪生模型”定义为“全球最先进的编程与知识工作模型”,其中Fable 5.1面向所有用户与企业全面开放,Mythos 5.1则向经过审核的美国网络安全与生命科学机构提供。这是Anthropic继今年6月发布Fable 5系列之后,三个月内再次更新自家旗舰。
![]()
在多项核心基准测试中,Fable 5.1实现了代际式跃升,其中衡量AI自主科研能力的Terminal-Bench-Science0.1得分从上一代的24.7%飙升至52.6%。与此同时,Anthropic还宣布将缓存读取价格大幅下调,并推出全新的企业级前沿安全系统。
根据Anthropic官方公布的价格信息,Fable 5.1的基础输入和输出价格保持不变,仍为每百万Token输入10美元、输出50美元,与Fable 5持平。但缓存读取(Cache Read)价格从此前的每百万Token1美元大幅下调至0.25美元,降幅高达75%。
缓存读取是指模型读取已经处理并存储过的输入内容时的计费项,在实际的智能体任务和长对话场景中,大量重复读取缓存是常态,因此这一降价对实际使用成本的影响远超表面数字。
Anthropic官方测算,典型工作负载下Fable 5.1的使用成本比Fable 5低约25%,而对于高度智能体化的工作负载,成本降幅最高可达约45%。此外,Fable 5.1保持了100万Token的上下文窗口和12.8万Token的最大输出长度。
根据Anthropic官网发布的技术报告,Fable 5.1与Mythos 5.1是同一底层模型的两种配置形态。Fable 5.1作为公开版本,加装了更为严格的安全护栏,能够防止模型在生物学、网络安全等高风险双重用途领域执行特定任务;Mythos 5.1则在这些领域采用更为宽松的安全策略,直接访问权限仅限于通过可信访问计划审核的个人和组织,其能力同时为面向所有Claude企业客户的Claude Security产品提供支持。
Anthropic表示,这种“同一模型、两套安全策略”的发布模式,旨在在推动模型能力前沿突破的同时,有效管控高风险领域的潜在滥用。
性能表现上,在最具标志性的Terminal-Bench-Science0.1基准测试中,Fable 5.1以52.6%的得分将上一代Fable 5(24.7%)和Open AI的GPT-5.6Sol(22.4%)甩在身后,甚至超过了自家定位更高的Opus 5(29.0%),实现了超过一倍的性能跃升。这一基准测试衡量的是AI模型在终端环境中自主完成科学研究任务的能力,被业内视为判断模型科研潜力的核心指标。
![]()
Fable 5.1 在各类基准测试中的表现
在衡量终端编码能力的Terminal-Bench4.0测试中,Fable 5.1得分达到55.8%,较上一代的42%大幅提升,而安全护栏更宽松的Mythos 5.1更是达到60.9%。在其他多项基准测试中,Fable 5.1同样全面领先:GDPval-AA v2知识工作测试得分1853分,超越Opus 5的1824分;Automation Bench业务流程自动化得分31.4%,较上一代的17.1%近乎翻倍;Cursor Bench3.2.0智能体编码测试得分73.4%,Humanity's Last Exam多学科推理测试在有工具辅助下达到65%,OSWorld 2.0计算机操作测试在严格评分标准下达到41.7%,均创下新的纪录。
![]()
Fable 5和Fable 5.1上运行相同工作负载的成本对比
值得注意的是,Fable 5.1在低、中等推理强度设置下,性能已经能够接近甚至超过上一代Fable 5在最高推理强度下的表现。官方数据显示,当Fable 5.1设置为Low或Medium推理强度时,在多数任务上的表现与Fable 5的High设置相当或更优,而单次任务成本显著降低。
Anthropic在官网介绍中用大量篇幅展示了Fable 5.1与Mythos 5.1在真实科学研究中的表现。在蛋白质设计领域,Mythos 5.1调用开源蛋白质设计与折叠工具生成结合剂,交由两家外部机构实验验证,在3个靶点上亲和力达到Adaptyv Bio竞赛最佳方案的10倍,12个靶点有效结合剂命中率接近50%,而行业典型水平为10%—15%。
![]()
Fable 5.1在天文计算领域的表现
在天文计算领域,Fable 5.1基于NASA麦哲伦号30多年前的雷达数据训练神经网络,重绘金星约三分之一表面的高分辨率高程图,分辨率从10—20公里提升到2—3公里,高程精度提高最多25%,地图以Creative Commons许可开源。在GPU内核优化方面,Mythos 5.1为7个开源深度学习模型编写定制GPU内核并缓存中间结果,推理速度最高提升2.5倍,全基因组分析GPU成本预计降低30%—60%。
不过,基准测试成绩并不完全等同于实际使用体验,不同模型在不同任务类型和应用场景下各有优劣,Fable 5.1在编码和科研任务上表现突出,但在创意写作、多模态理解等维度的表现仍有待实际用户的广泛验证。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.