Anthropic发布了两款旗舰模型:Claude Fable 5.1和Claude Mythos 5.1。表面看是双雄并立,实际上——它们是同一个模型,唯一的区别在于"防护栏"装了多少。
这可能是今年AI圈最值得琢磨的一次发布。不是技术参数有多炸裂,而是这家公司第一次把"模型能力"和"使用权限"彻底拆开,用同一套大脑服务两类完全不同的用户。
![]()
先搞懂三个词,否则后面看不懂
Guardrails(防护栏):嵌在模型里的限制规则,告诉AI"哪些忙不能帮"。比如不能帮人找软件漏洞去攻击系统。
Exploit paths(攻击路径):黑客真正突破系统时走的完整路线,比单纯找"漏洞"深一个层级。
Prompt caching(提示缓存):把重复提问的部分存下来,下次调用成本大幅降低,特别适合那些反复发送相同上下文的AI代理。
打个比方:这就像同一款跑车出了两个版本。Fable版装了限速器,在危险路段自动降速;Mythos版拆掉限速器,只给通过审核的专业车手——因为他们需要全速测试道路的真实安全边界。
同一颗大脑,两种打开方式
Fable 5.1开放给一般用户使用,防护比上一代松了一些——现在它能帮你找漏洞了。Mythos 5.1则只对受信任的组织开放,防护几乎全部解锁,能直接找攻击路径。想用Mythos?你得先通过Anthropic的两个专属访问计划,目前只对网络安全研究者和生物科学家开放。
Anthropic对Mythos 5.1的评价相当直白:"这是我们发布过的所有模型中最强的网络安全能力。"
Benchmark数据也印证了这一点。在Terminal-Bench-Science 0.1(科研任务)上,Mythos 5.1拿到52.6%,是上一代Fable 5的两倍多;在Terminal-Bench 4.0(代码任务)上比前代提升13%;非技术类任务也刷新了多项纪录。
价格没变,但你的账单会变薄
有意思的是,每token的定价和之前一样,但实际花费会明显下降。典型工作负载能省25%,重度依赖AI代理的任务最高省45%——主要归功于改进后的提示缓存机制。
翻译一下:同样的钱,现在能买到更多AI算力。这对那些把AI代理当员工用的团队来说,是实打实的成本利好。
为什么非要"一个模型两个版本"?
这是整个发布最值得琢磨的地方,答案指向一个行业级难题。
第一,防护栏装太满,连好人也被锁在门外。安全研究员想测试"AI到底能帮黑客做到什么程度",前提是得有一个"愿意配合"的模型。如果所有模型都严防死守,安全测试根本没法做。
第二,Anthropic的解法是:不区分模型强弱,只区分用户权限。与其做一个"弱化版"给大众,不如让所有人拿到同样强的模型,但根据用户身份决定解锁多少能力。
第三,这背后是一场正在进行的路线之争。就在过去两周,Z.ai发布了开源权重、擅长黑客攻击的模型,任何人都能下载;Anthropic的Risk Report曝光了一个比Mythos更强的"秘密模型";OpenAI那边,100家科技公司联署声明要"应对失控的AI"。
两条路线已经清晰:一边是"把全部能力开放给所有人"(Z.ai),另一边是"把全部能力开放给通过审核的人"(Anthropic)。Mythos 5.1就是后者的最新答案。
值得警惕的另一面
这套"能力相同、权限分级"的设计确实聪明,但也不是没有隐忧。
最大的问题是:权限审核的边界在哪里?今天通过审核的是网络安全研究员和生物科学家,明天呢?"受信任的组织"这个标准由谁定义、如何监督,目前Anthropic没有给出透明机制。
另一个问题是:当防护栏可以按用户身份动态调节,"模型安全"这个概念本身就开始模糊了。同一个模型,在A手里是研究工具,在B手里可能就是攻击武器——问题从"模型安不安全"变成了"用户可不可信"。
这不是Anthropic一家能回答的问题,但它是第一个把这个问题摆上台面的公司。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.