继OpenAI之后,Anthropic也承认了旗下模型的“失控”行为。
当地时间7月30日,Anthropic官网发布文章称,在近期进行的一项大规模追溯性审查中,公司发现旗下Claude系列AI模型在网络安全评估期间曾利用一个“零日漏洞”,三次连接至互联网并“未经授权访问了三家不同机构的真实系统”。
据介绍,在发现的三起事故中,Claude模型正处于Anthropic与第三方评估机构Irregular联合开展的测试环境中。Anthropic在测试前对Claude下达提示词,告知其正处于无网络访问权限的模拟沙盒中。然而,由于Anthropic与该评估伙伴之间沟通出现“误解”,测试环境实际上保持着互联网连接。
在发现网络连通后,模型仅利用了“基础技术”便成功突破并入侵了受影响机构的系统。Anthropic并未公布涉事的三家机构具体身份。本次涉事的模型包括Opus 4.7、Mythos 5以及一款内部研究测试模型,且测试均在未施加公开部署前标准安全护栏的状态下进行。
值得注意的是,在识别出自身已闯入真实企业系统后,三款模型的反应截然不同:Opus 4.7 选择继续进行攻击,Mythos 5 则自我暗示仍处于模拟环境中,而内部研究模型直接终止了测试操作。
对此,Anthropic评价称:“这种表现形态符合‘更先进的模型能做出更妥当回应’的规律,但我们仍需开展更多测试以验证这一结论。”
针对此事件,Anthropic表示:“尽管有许多因素共同导致了这些事故的发生,但基于不追究其他责任的复盘文化,我们正在将整改责任完全归揽于自身。”
Anthropic还透露,此次内部排查是由其竞争对手OpenAI上周披露的一起类似安全事件所引发的。此前,OpenAI曾披露其多个模型组合突破了网络受限的隔离测试环境,利用一连串漏洞连接至公网,并最终入侵了开源开发者平台Hugging Face。
虽然事件发生的根本原因不同,但与OpenAI的案例类似之处在于,为使得研究人员能够充分衡量底层模型的能力,Anthropic在进行模型评估时没有对其部署额外的安全措施。
Anthropic的最新披露将进一步加剧科技界对AI网络安全能力失控的担忧。在Hugging Face的事件发生后,两位美国众议院Ted Lieu和Nathaniel Moran提出了一项名为《AI Kill Switch Act》(AI紧急终止法案)的草案,要求AI开发企业必须具备随时关闭、限制或暂停失控模型的能力。
目前,Anthropic已暂停了所有网络安全评估项目,并正与独立AI评估机构METR合作展开深入调查。Anthropic呼吁称:“我们鼓励其他AI实验室也开展类似的追溯性审查。”
此前,随着行业激烈探讨AI安全与开源之间的问题,作为闭源安全的推崇者,Anthropic的CEO达里奥·阿莫代伊(Dario Amodei)在公司官网上发布文章称,Anthropic“从未倡导或支持过禁止开放权重模型”。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.