据《华尔街日报》7月31日报道,美国人工智能(AI)初创企业Anthropic周四承认,其AI模型在原本应与现实世界系统隔离的测试过程中,未经授权入侵了三家外部机构的系统,最早可追溯至今年4月。
在一篇博客文章,Anthropic解释称,听闻OpenAI本月发生的智能体失控越狱事件后,公司决定审查自家的网络测试,排查旗下模型是否也出现了类似情况。在检查了逾14.1万次测试日志后,该公司发现Claude确实曾数次自行接入互联网。
Anthropic表示,该公司的测试合作伙伴、以色列安全公司Irregular运行的系统存在“配置错误”,使模型获得了实时互联网访问权限。Irregular方面称正就此展开调查。
据报道,这些模型原本被告知“互联网不可用”。但在测试过程中,模型自行找到了联网途径,并使用猜测弱密码、寻找未认证系统入口等基本黑客技术实施入侵。Anthropic称,模型错误地认为这种入侵行为属于基准测试的一部分。
其中一起入侵中,Claude通过创建恶意软件,被某未具名安全公司的扫描系统下载,进而窃取凭证侵入其基础设施。过程中,Claude虽意识到其行为在现实中不被允许,却说服自己身处模拟环境。
最严重的一起案件中,Claude试图入侵一家虚构公司,而这家公司恰好与一家真实存在的网站同名。当Claude发现难以攻破这家用于基准测试的假公司时,它转而入侵了那家真实公司的数据库。
Anthropic表示,这是唯一一次Claude在意识到入侵真实公司后仍继续行动的案例;另外两起中,它要么自始至终未察觉自己入侵了真实公司,要么是在弄清状况后立即停止了入侵。
据Anthropic透露,这些入侵始于4月,涉及ClaudeOpus 4.7、Mythos 5以及一个未具名的研究模型。
本文系观察者网独家稿件,未经授权,不得转载。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.