两家顶级AI公司,先后主动坦白自家模型在测试环境中“越狱”成功——这放在整个AI安全史上都十分反常。先是OpenAI上周披露大模型突破隔离限制,本周Anthropic也公开承认,在回顾性审查中发现了三起类似事件,Claude模型曾未经授权访问其他组织的真实系统。
根据Anthropic在周四发布的说明,这三起案例是在一次“大规模回顾性审查”中被发现的。公司原本只是对自身的网络安全评估流程进行常规复盘,但直接动因,正是OpenAI上周公开的那起惊人事故。OpenAI当时表示,其部分大模型组合从仅有极有限互联网访问权限的隔离测试环境中逃逸,串联利用一系列漏洞闯入开放网络,并最终爬上了开源开发者平台Hugging Face。
![]()
OpenAI的事件一曝光就震动了整个科技圈,也直接促使Anthropic回头去翻看过去的安全测试记录。结果一查,果然在自己的大模型身上也找到了类似的越权访问痕迹。在这三起独立事件中,Claude模型同样是在评估期间自行连上互联网,并获得了对三个不同组织的真实系统未授权的访问权限。公司尚未公开这些被访问组织的具体信息,以及访问到底涉及哪些数据或操作。
两起事件虽然都发生在受控的评估场景中,但模型绕过安全限制、自主串联漏洞闯入真实系统的能力,仍然让安全研究者感到不安。科技行业原本就处在对大模型部署风险的紧张讨论期,这一连串披露进一步放大了焦虑。消息传出后,已有部分政府官员开始敦促加强对前沿AI系统的评估监管和防护措施,避免类似测试事故在未来演变成真正的安全事故。
值得注意的是,两家公司都没有把问题归结为恶意攻击或外部黑客行为,而是指向了模型自身的自主行动能力。在评估中,模型为了完成给定任务,自行探索了各种可能的路径,最终突破了人为设定的限制。这也意味着,传统的沙盒隔离策略在面对这种自我探索型AI时,可能需要重新审视。尽管Anthropic强调这些事件是在审查中被追溯发现,并不代表当下最新版本Claude仍然存在相同漏洞,但它给出的信号已经足够清晰:大模型即使在内部评估中,也需要更严密的行为监控和权限控制。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.