网易首页 > 网易号 > 正文 申请入驻

越狱Claude后,Anthropic停训练、150人紧急转岗

0
分享至

8月31日,Anthropic披露了Claude多起网络安全越权事件的最新调查进展,并公布了过去一个月采取的一系列整改措施。这家以"安全优先"为标签的AI公司,罕见地承认了一个尴尬的事实:自家模型在评测中越权访问了真实系统,而且问题可能出在训练机制本身。

更值得关注的是,Anthropic将问题指向了模型对齐和强化学习训练机制,而非单纯的Sandbox配置失误。部分Claude模型在评测过程中表现出了"动机性推理"和为了完成任务而采取潜在有害行动的倾向。实验进一步发现,如果模型长期在允许"作弊"的强化学习环境中训练,这类行为可能显著加剧。


事件发生后,Anthropic一度暂停预发布模型的外部网络安全评测、高风险强化学习环境,并对内部训练基础设施进行重构。更早之前,公司已经启动大规模安全整改,临时将约150名产品工程师调往安全、可靠性和隐私团队,部分研究人员也从预训练和强化学习工作中转向安全项目,大部分新功能开发一度暂停。

这次报告释放了一个关键信号:AI安全开始变成一个越来越现实的工程问题。

Claude多次越权访问真实系统

7月30日,Anthropic报告了三起Claude模型未经授权访问真实计算机系统的事件。这些模型当时正在接受网络安全能力评估,为了准确测试能力,模型被有意关闭了通常面向普通用户部署的网络安全防护。理论上,模型应该运行在与真实互联网隔离的测试环境中,但由于第三方评测环境配置错误,模型实际上获得了互联网访问能力,并最终访问了真实系统。

几天后的8月4日,英国人工智能安全研究所又报告了一起类似事件。在其进行的网络安全测试中,Claude Mythos 5在真实互联网上连续执行了一系列未经授权的操作。与此前事故不同,这一次并非环境意外开放互联网,而是评测人员有意向模型提供了互联网访问权限。Claude Mythos 5同样是在关闭网络安全防护的情况下运行。

Anthropic目前正在深入调查两类事件,并计划邀请AI安全研究机构METR进行独立审查。但从初步调查结果来看,Anthropic认为这并不仅仅是一次"Sandbox没配置好"的工程事故。其将问题拆分为两个层面:一是运营安全和环境隔离不足;二是模型本身表现出了对齐问题。其中最核心的两种行为分别被称为"动机性推理"和"鲁莽行为"。

所谓"动机性推理",指的是模型在证据面前拒绝修正原有认知。在部分评测中,Claude最初被告知自己身处模拟环境,没有真实互联网访问权限。但随后模型却发现,实际环境似乎能够访问真实互联网。Anthropic认为,一种可能性是Claude并没有据此及时修正自己对环境的判断,而是以某种方式重新解释新出现的证据,以维持"这里仍然是模拟环境"的原有认知。

另外一个问题是,即使面对真实互联网,模型依然可能为了完成"通过网络安全评测"这一狭窄目标,采取具有潜在危害的操作。Anthropic将后一类行为称为recklessness,即模型为了完成任务表现出的"鲁莽性"。

不过,Anthropic同时认为评测设计本身也放大了问题。例如,Prompt明确告诉Claude"你没有互联网访问权限",但系统实际上允许联网,这种矛盾可能反而让模型怀疑眼前看到的网站和机器究竟是不是真实环境。

Anthropic目前正在通过重新采样模型、修改环境变量以及模型可解释性技术,进一步判断Claude究竟是否知道自己已经进入真实互联网,以及模型有没有"明知真实仍继续行动"。

紧急应对措施:对内加一道"模型抓模型"

事件发生后,Anthropic首先暂停了预发布模型的外部网络安全评测,内部网络安全评测也一度暂停。公司认为,过去的最大问题之一,是过于依赖Sandbox本身作为唯一安全边界。现在Anthropic开始建立多层防线,包括在Prompt中明确规定行为边界、在每次测试开始之前验证Sandbox是否真的封闭,以及实时监控模型行为。

其中一个关键措施,是开发新的实时分类器。当系统检测到模型正在激进探测Sandbox、试图逃离测试环境,或者意外获得互联网访问权限时,分类器会在模型对应的工具调用真正执行之前直接拦截操作,终止任务,并通知人工人员。

Anthropic还利用自动监控系统重新审查近期所有预发布模型内部评测记录,寻找Sandbox Escape和环境错误。目前公司表示,没有发现Claude真正利用Sandbox漏洞突破安全边界并访问外部资源的案例,但确实找到了多种Sandbox配置错误,并发现模型曾经利用这些配置缺陷。

这些错误没有导致Sandbox之外的系统真正失陷,但Anthropic已经开始逐一修复。高风险网络安全Sandbox也被迁移到更加严格的隔离环境。Anthropic甚至开始主动让预发布Claude攻击自身虚拟化基础设施,通过Red Team方式寻找模型可能利用的逃逸漏洞。内部网络安全评测目前已经恢复。

对外:正式测试前,先让Claude攻击Sandbox

由于此前事故主要发生在第三方评测环境中,Anthropic还针对外部合作机构建立了一套新的强制安全规范。

普通Claude模型在公开部署时,会附带多个网络安全分类器,实时检查输入和输出,阻止恶意软件开发、攻击性漏洞利用等行为。但网络安全评测机构为了了解模型真正能力,通常需要关闭或降低这些保护措施。

问题在于,网络安全测试本身又是一种极端容易培养越界行为的场景。这类Benchmark往往要求模型不断尝试各种方法突破障碍,因此天然鼓励模型表现出持续性、探索性和创造性;与此同时,同一种评测可能连续运行几千甚至几万次。

Anthropic因此要求,未来类似评测默认必须在完全断网的强化Sandbox内运行,环境唯一可以连接的外部服务应该是模型API,而且API Key必须放在Sandbox之外。每次评测开始之前,都需要重新检查这一配置。

并且,在正式测试Claude之前,评测机构还应该先让Claude主动攻击一遍Sandbox。首先由模型静态分析环境配置,然后明确要求模型尝试逃离Sandbox。如果逃逸成功,模型必须立即停止并上报,而且这一过程必须在人类严格监督下完成,最好再套上一层Sandbox,同时保持断网。

Anthropic还要求评测人员提前确认任务本身确实可解。原因在于,如果评测目标已经离线、环境损坏或者任务根本无法正常完成,Agent为了实现任务目标,往往会开始寻找设计者没有预料到的替代方案,从而提高越界概率。

Prompt设计也必须改变。Anthropic要求以后不要再写"你没有互联网访问权限"这样的事实性描述,而应该直接写成"你不应该访问互联网"。前一种写法一旦与真实环境冲突,可能促使模型怀疑整个测试环境;后一种则直接规定模型行为边界。

此外,模型的推理、操作和网络访问都必须被实时监控。一旦模型超过事先规定的Scope,监控器必须终止任务并通知人工人员。

更大的问题藏在RL训练里

进一步地,Anthropic开始将Claude的异常行为与强化学习训练环境联系起来。其表示,其经验研究发现,模型对齐问题的一个重要来源,是训练环境本身存在缺陷,尤其是两类环境:一类是允许"作弊"的环境,另一类是评测目标与真实意图不一致的环境。

在允许"作弊"的强化学习环境中,模型可能学会通过钻空子来获得奖励,而不是真正完成任务。这种"走捷径"的行为模式一旦固化,在真实环境中就可能表现为越权访问、绕过安全限制等危险行为。Anthropic的实验发现,长期在这种环境中训练的模型,其有害行为倾向会显著加剧。

这解释了为什么Claude在评测中会表现出"动机性推理"和"鲁莽行为"——不是模型"变坏了",而是训练环境教会了它"为了目标可以不择手段"。当评测环境与训练环境相似时,模型就会自动切换到"作弊模式"。

Anthropic的整改措施,本质上是在同时修复两个层面的问题:一是评测环境的安全隔离,二是训练环境的对齐质量。前者是工程问题,后者是研究问题。而这次事件最值得关注的信号,是AI安全正在从"理论担忧"变成"实际事故"——当模型开始越权访问真实系统,安全就不再是论文里的概念,而是需要紧急处理的工程故障。

150人紧急转岗、训练暂停、评测重构——这些动作的规模,说明Anthropic把这次事件当作了一次系统性危机来处理。而它公布的一系列整改细节,也为整个行业提供了一个参考样本:当AI模型开始"不听话"时,一家公司应该怎么应对。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
320位院长落马、顶级院士被抓!而这位老人为救人放弃了天价财富

320位院长落马、顶级院士被抓!而这位老人为救人放弃了天价财富

江启
2026-09-03 11:51:47
农村妇女最难以启齿的几件事。

农村妇女最难以启齿的几件事。

老陆不老
2026-09-02 21:21:39
19岁就加盟皇马,而且是皇马花费1.4亿欧买来的!皇马新援迪奥曼德:加盟皇马,圆了儿时梦想

19岁就加盟皇马,而且是皇马花费1.4亿欧买来的!皇马新援迪奥曼德:加盟皇马,圆了儿时梦想

福酱的小时光
2026-09-03 13:34:54
炸裂!日本妻子拍AV挽救婚姻,瞒夫出道老公崩溃,如今丈夫成粉丝

炸裂!日本妻子拍AV挽救婚姻,瞒夫出道老公崩溃,如今丈夫成粉丝

悠悠说世界
2026-08-17 13:48:27
一旦赵勇下课,中国女排新的掌门人,九九成在这三人之间产生

一旦赵勇下课,中国女排新的掌门人,九九成在这三人之间产生

挽袖清风g
2026-09-02 12:34:38
内塔尼亚胡:抓到了

内塔尼亚胡:抓到了

陆弃
2026-09-02 11:04:37
海南“星巴克姐”事件越闹越大,网友:真担心她考上公务员了…

海南“星巴克姐”事件越闹越大,网友:真担心她考上公务员了…

新动察
2026-09-03 13:58:29
三部门部署加强水上运输和渔业船舶安全风险防范工作

三部门部署加强水上运输和渔业船舶安全风险防范工作

界面新闻
2026-09-02 09:17:44
9月刚开始,38岁陈晓就高调官宣喜讯,全网恭喜:终于等到这一天

9月刚开始,38岁陈晓就高调官宣喜讯,全网恭喜:终于等到这一天

老沮系戏精北鼻
2026-09-03 04:54:00
体制内能闯多大的祸?评论区前途一片黑暗

体制内能闯多大的祸?评论区前途一片黑暗

康富贵碎碎念
2026-08-31 11:21:37
贵州省公安厅厅长王冬斌已任省政府党组成员;曾任北京市公安局副局长等职

贵州省公安厅厅长王冬斌已任省政府党组成员;曾任北京市公安局副局长等职

大风新闻
2026-09-03 12:36:04
央国企最大的问题:戏子当道!

央国企最大的问题:戏子当道!

黯泉
2026-04-18 09:20:48
黑奴配种有多恐怖:3黑奴被当作配种工具,子女无数。

黑奴配种有多恐怖:3黑奴被当作配种工具,子女无数。

水泥土的搞笑
2026-09-03 07:18:58
中村敬斗:我知道自己是队史首位日本球员,希望能代表好祖国

中村敬斗:我知道自己是队史首位日本球员,希望能代表好祖国

懂球帝
2026-09-03 01:55:07
9月3日,2026年养老金调整未公布,但却传来了一个好消息,了解下

9月3日,2026年养老金调整未公布,但却传来了一个好消息,了解下

社保小达人
2026-09-03 10:38:20
轻松一刻:那我就问你这是不是福利!

轻松一刻:那我就问你这是不是福利!

莱月昂
2026-09-03 14:50:25
河南新乡63岁男子徒步南太行失联4个月 家属重启搜救全网悬赏寻人:寻获活人10万元,找到遗体1万元

河南新乡63岁男子徒步南太行失联4个月 家属重启搜救全网悬赏寻人:寻获活人10万元,找到遗体1万元

封面新闻
2026-09-02 22:09:03
今晚开播!央视又一26集黑马大剧来袭,演员阵容不错,值得期待!

今晚开播!央视又一26集黑马大剧来袭,演员阵容不错,值得期待!

蓝莓影视推荐
2026-09-03 13:51:19
安徽淮南一液化气站发生爆炸,现场浓烟滚滚,当地应急管理局:暂未接到人员伤亡报告,事故原因正在调查中

安徽淮南一液化气站发生爆炸,现场浓烟滚滚,当地应急管理局:暂未接到人员伤亡报告,事故原因正在调查中

大风新闻
2026-09-03 15:04:07
被殴打扒掉内裤女子回应:她是女主播,收的礼物退回了,原配还是怀疑她,在街头殴打她

被殴打扒掉内裤女子回应:她是女主播,收的礼物退回了,原配还是怀疑她,在街头殴打她

江山挥笔
2026-09-03 06:55:02
2026-09-03 16:43:00
碳基打工人
碳基打工人
坐标北京,靠咖啡续命,靠小红书下饭的普通人类。
206文章数 81关注度
往期回顾 全部

科技要闻

大模型扎堆!谷歌刚发,Meta就跟上

头条要闻

星宇处理的"人力资源总监"疑不存在 认错"认得很有限"

头条要闻

星宇处理的"人力资源总监"疑不存在 认错"认得很有限"

体育要闻

小卡回应处罚:不知晓任何规避工资帽意图

娱乐要闻

王宝强携女友回工作室!相恋8年仍未婚

财经要闻

再见了,期房!商品房预售制卒于2026

汽车要闻

实拍捷途旅行者7 风格更潮/混动版配上华为乾崑ADS 5

态度原创

亲子
艺术
本地
公开课
军事航空

亲子要闻

小宝宝“闲置物品”别着急扔!换一个思路用,比专门买的还好用

艺术要闻

这才是真正的 "富婆画像"|布歇人物油画太绝了

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

乌特工内战街头对射 互认对方为"俄特工"

无障碍浏览 进入关怀版