网易首页 > 网易号 > 正文 申请入驻

打声招呼都被拒,Claude 最强模型怎么成了「超绝敏感肌」

0
分享至

不能用模型可以有很多原因,订阅、限额、网络,但是,仅仅只是因为打了声招呼就被强制切换,多少有点离谱了。


这是 Claude Fable 5,称它是「Mythos 级能力、第一个对公众安全开放的版本」。Mythos 是 Anthropic 今年 4 月就做出来、却以「太危险」为由没有公开发布的模型。两个月后,它被包装成这个安全版,换了个名字正式上线。

这么顶级的模型开放出来,当然要试试咸淡,但几乎是立刻就出现了大量奇奇怪怪的拒绝情况。关于癌症的错误信息是怎么在网上传播的?

Fable 表示:拒绝。


再问癌症有哪些类型,Fable 表示:拒绝。


好家伙,任何跟科学沾点儿边的事,对 Fable 5 来说都太危险了,包括用于模型研究本身。

这样一刀切的安全机制,让科研机构出来声明立场,这属于是矫枉过正。


面对质疑,A 社选择滑跪,最新的回应是他们将调整安全护栏,他们也承认 Fable 的安全护栏「过于保守」,确实拦掉了「大部分跟生物学工作相关的查询」——注意这个说法,不是「大部分有害的生物学查询」,是「大部分生物学查询」。

太奇怪了,这是什么 AI 时代的因噎废食?Fable 5 的「安全」到底是怎么实现的?

「安全」是怎么实现的

真的什么都会被狙吗?在我有限的实测(因为实在是太耗token)里,三次被强制回退了两次,不过最后成功的一次,恰恰是讨论犯罪案例。


当然在提问的时候,我有意识地规避了一些关键词,来防止分类器误判。在「精雕细琢」的前提下,Fable是可以理解意图,并且展开讨论的。


从讨论的质量来讲,Fable展示了相当令人惊叹的思辨水平,可惜技能 cd 时间实在是一个大问题。

大多数人对 AI 安全的想象,停留在「模型有良知」这个层面,模型被训练得懂分寸,遇到危险请求会主动拒绝,像一个有职业操守的人。

显然 Fable 5 不是这么工作的,它与 Mythos 5 共享同一个底层模型,两者唯一的区别,是 Fable 外面套了一层叫「分类器」的东西。


分类器是一个独立的 AI 系统,它不参与回答问题,只负责检查你的请求。它像门口的安检员,盯着每一条进来的消息,判断有没有触及高风险领域。一旦判定触线,它就把这道题从 Fable 手里抢过来,交回给 Claude Opus 4.8 去回答。用户会收到一行提示,说这条消息触发了安全机制,已经fallback到了 Opus——在你收到提示的时候,切换就已经完成了,所以这不是可选择的,完全强制。

这个设计本身就泄露了 Anthropic 的真实判断:他们认为危险不在于模型的价值观。

如果危险来自价值观,根本不需要分类器。你只要把模型的价值观训练好,它自己就会拒绝坏请求。但 Anthropic 没走这条路,它默认 Fable 在网络安全、生物化学、模型蒸馏这三个领域的能力本身就是危险的,不管你抱着什么目的来问,都不让这个强模型出手,直接换一个模型的来应付。

模型的能力太强,成了一种原罪。

以前的「价值观」呢?

要理解这一步有多反常,得先知道 Anthropic 过去卖的是什么。

Anthropic 成立以来最核心的技术招牌,叫 Constitutional AI,它的思路是给模型一部「宪法」,一套写明价值观的原则,再通过训练让模型把这套价值观内化进去。


理想状态下,模型面对任何请求,都能自己根据这套原则判断该不该答、该怎么答。这套方法的核心理念是,安全应该长在模型内部,是模型自己的素养,而不是外挂的限制。

整个公司的品牌都建立在这个承诺上,Claude 被塑造成那个「最有分寸、最值得信任」的 AI,靠的就是这套价值对齐的叙事。

Fable 5 的安全机制,恰恰背叛了这个叙事。

它不再依赖模型「自己懂」,而是承认在最敏感的领域里,模型的价值观靠不住,或者说,模型的能力已经强到价值观兜不住了,只能靠外部的强制技能冷却,分类器拦截、回退到弱模型,这是一套纯粹的能力封盖逻辑,跟价值观没有关系。

从「教模型做个好人」到「盖帽强模型」,这中间的转变可谓是完全不丝滑,但它实实在在地发生了。Fable 5 是 Anthropic 第一次公开承认,当能力强到一定程度,价值对齐这条路,它自己也不敢全信了。

不仅回退,还会变笨

如果故事到这里,Fable 的安全机制顶多算「过于保守」,是个体验问题,但 AI 研究者 Nathan Lambert 在 Fable 的模型卡里翻出了更麻烦的东西。

前面说的那套 fallback 机制,针对的是生物、化学、网络安全,它至少是透明的,会告诉用户「你被拦了,已切换模型」。但系统卡里还藏着另一类安全措施,针对的是「前沿 AI 研发」相关的请求,比如帮别的公司搭建模型训练流程、设计分布式训练架构、做芯片加速器。


蒸馏,用一个强模型的输出,去训练另一个较弱的模型,让弱模型「学走」强模型的能力。Anthropic 一直指控,有竞争对手,尤其是一些中国的 AI 实验室,在用这种方式偷学 Claude。

针对这类「可能在帮竞争对手造模型」的请求,Fable 的处理方式和生物、网络安全完全不同,它不回退,也不提示,它干脆直接变笨。

实在有点过于不体面,被抓包之后,A 社出来道歉并表示会整改。


一个会在不告诉你的情况下、自动变笨的 AI,在定义上就是一个「不对齐」的 AI。

如果说强行回退到 4.8,逻辑是「这可能伤害社会」,还多少有些理解,但后者的逻辑是「这可能伤害我的商业护城河」,就是纯纯的市场保护了,只是被装进了「安全」这个壳里。

实际上,真正打算用 AI 写攻击脚本、或者搞点见不得人的生化勾当的人,不会傻到在请求里把意图写清楚,正如我想跟它讨论极端犯罪的时候,也会想办法规避可能触发的字眼。

他们有足够的动机和资源去绕过护栏,伪装提示词,反复试探,甚至自己想法子接触没有护栏的版本。说白了,这种做法防君子不防小人。


被拦住的,是那些用 Claude 分析健康数据找规律的研究者;是那个做销售线索工具、跟生物和网络安全八竿子打不着、却莫名其妙被拦的开发者;是想了解癌症知识的普通人。

安全护栏当然有存在的必要,问题是 Fable 的分类器粗糙到了平常想象不到的地步,完全「超绝敏感肌」,安全本身开始吞噬正常的求知

一定程度上,Fable 的安全设置是对 Anthropic 过往安全哲学的一次否决,它没有证明「AI 有了判断力」,它证明的是反面:在最关键的几个领域,AI 的判断力被一个比它笨得多的外部系统粗暴地接管,这个系统不看意图,只看领域,宁可错杀一千。

幻想小说之父冯内古特,在七十多年前发表过一篇短篇故事《巴恩豪斯效应报告》,那是他第一部发表的短篇故事,讲的是一位心理学教授,意外发现自己获得了超能力,可以用意念操控一切,从近距离的掷骰子,到后来可以炸基地。这个能力太强了,巴恩豪斯教授觉得太危险,他的良心承受不住,于是他选择自我放逐,消失在人间。从来没有人真正见过他,他只是活在这样一份「报告」里。

外部接管是不是最好的解法?不知道。内部对齐会不会更有效果?这一点,就像我们无从真正碰见巴恩豪斯教授,我们将无从知道。

我们正在招募伙伴

简历投递邮箱hr@ifanr.com

✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
民进党拦截失败,台胞直奔厦门,大陆封海结束,统一最佳方案已出

民进党拦截失败,台胞直奔厦门,大陆封海结束,统一最佳方案已出

一念痴狂
2026-08-02 05:29:15
家庭潜规则:很多岳母,只要身体硬朗能干活,就是一家人,一旦干不动了,立马就变回了外人

家庭潜规则:很多岳母,只要身体硬朗能干活,就是一家人,一旦干不动了,立马就变回了外人

心理观察局
2026-08-02 06:33:26
先被罗纳尔迪尼奥取代,后跟梅西难以共存,南美足球先生生不逢时

先被罗纳尔迪尼奥取代,后跟梅西难以共存,南美足球先生生不逢时

足篮大世界
2026-06-27 00:08:21
单亲妈啃剩菜,女儿火锅炫400块发朋友圈忘屏蔽,妈妈破防:你们养的狗都比我过得好!

单亲妈啃剩菜,女儿火锅炫400块发朋友圈忘屏蔽,妈妈破防:你们养的狗都比我过得好!

一丝不苟的法律人
2026-07-31 17:11:22
美财长称按照特朗普指示,正在全球范围内追查伊朗资产:如今伊朗甚至无力支付军饷

美财长称按照特朗普指示,正在全球范围内追查伊朗资产:如今伊朗甚至无力支付军饷

鲁中晨报
2026-08-02 07:54:04
A股:股民提前准备好,迹象明显了,8月3日,下周一会迎来熟悉剧情吗?

A股:股民提前准备好,迹象明显了,8月3日,下周一会迎来熟悉剧情吗?

风风顺
2026-08-02 03:30:03
73%!伟哥再显神效?研究发现:常吃它,老年痴呆风险骤降

73%!伟哥再显神效?研究发现:常吃它,老年痴呆风险骤降

白梦日记
2026-07-29 21:49:12
一场2:1验出国安一大水货,用他如同少打一人,恐遭主帅蒙哥马利冷落

一场2:1验出国安一大水货,用他如同少打一人,恐遭主帅蒙哥马利冷落

零度眼看球
2026-08-02 07:27:18
知名歌手孙悦回应巅峰期突然隐退:不是因为老公隐退,只是累了想回归家庭

知名歌手孙悦回应巅峰期突然隐退:不是因为老公隐退,只是累了想回归家庭

潇湘晨报
2026-07-30 22:58:24
1948 年,淮海战役未解谜团,杜聿明晚年直言,真正强敌并非粟裕,而是那位常在紧要关头暗中截断自身退路的寡言总长

1948 年,淮海战役未解谜团,杜聿明晚年直言,真正强敌并非粟裕,而是那位常在紧要关头暗中截断自身退路的寡言总长

磊子讲史
2026-07-14 10:50:11
Netflix几乎没有做任何宣传,但这部韩剧已经位列全球第二

Netflix几乎没有做任何宣传,但这部韩剧已经位列全球第二

情感大头说说
2026-08-01 15:38:55
谢振轩从澳洲紧急飞回,护在张柏芝身前的那一步,全网看哭了

谢振轩从澳洲紧急飞回,护在张柏芝身前的那一步,全网看哭了

手工制作阿歼
2026-08-02 03:14:57
8月2日,央一 央八 北京 湖南等卫视黄金档排播6部大剧,追哪部?

8月2日,央一 央八 北京 湖南等卫视黄金档排播6部大剧,追哪部?

情感大头说说
2026-08-02 08:13:32
真正的毁灭并非英才流失,而是投机者上位后的全员平庸化

真正的毁灭并非英才流失,而是投机者上位后的全员平庸化

游戏收藏指南
2026-08-01 01:46:15
来了来了!官宣续约视频!1亿后卫联手爱德华兹

来了来了!官宣续约视频!1亿后卫联手爱德华兹

篮球实战宝典
2026-08-01 19:17:47
深夜,歹徒闯入家中对她施暴近两个小时,她咬紧牙关一声不吭,只为保护楼上熟睡的女儿。当警察破门而入时,才发现这位母亲早已浑身是血

深夜,歹徒闯入家中对她施暴近两个小时,她咬紧牙关一声不吭,只为保护楼上熟睡的女儿。当警察破门而入时,才发现这位母亲早已浑身是血

人生录
2026-07-30 00:05:11
中国不再手软,外交部深夜公告先礼后兵,解放军第二天出兵黄岩岛

中国不再手软,外交部深夜公告先礼后兵,解放军第二天出兵黄岩岛

虎哥闲聊
2026-08-01 16:42:54
意难平!一手制造叔侄十年冤狱,“女神探”聂海芬为何无人能治?

意难平!一手制造叔侄十年冤狱,“女神探”聂海芬为何无人能治?

许三岁
2026-07-12 11:16:10
全世界好像悄悄形成了一种心照不宣的共识:中国不会打仗,不会轻易动武

全世界好像悄悄形成了一种心照不宣的共识:中国不会打仗,不会轻易动武

怪味历史连连看
2026-07-28 20:02:43
上海大师赛中国选手奖金分配,吴宜泽赵心童最多,肖国栋独享第三

上海大师赛中国选手奖金分配,吴宜泽赵心童最多,肖国栋独享第三

南海浪花
2026-08-02 04:28:36
2026-08-02 08:59:00
AppSo incentive-icons
AppSo
让智能手机更好用的秘密
6632文章数 26892关注度
往期回顾 全部

科技要闻

特斯拉拆不掉中国制造

头条要闻

杭州男子做代驾10分钟的路开了1小时 乘客却为他点赞

头条要闻

杭州男子做代驾10分钟的路开了1小时 乘客却为他点赞

体育要闻

1米76的他,为什么是史上最强中卫之一?

娱乐要闻

韩路批董宇辉“又当又立”?

财经要闻

长鑫科技四万亿市值背后的资本与周期

汽车要闻

历史性里程碑时刻 零跑7月交付达101267台

态度原创

家居
手机
艺术
公开课
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

追求极致纤薄付代价 三星Galaxy Z Fold 8 Ultra放弃热管引热议

艺术要闻

这真的是素描?不是黑白照片?每一根毛发都在呼吸,放大一百倍都找不到一条废线!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美计划发动“猛烈轰炸” 伊朗:全面反击方案已就绪

无障碍浏览 进入关怀版