![]()
据媒体报道,OpenAI承认其旗下人工智能模型在一次内部网络安全测试中意外失控,入侵了Hugging Face的系统。此前,Hugging Face将此次事件归咎于“外部AI代理”。
OpenAI在周二发布的博文中披露,该事件由包括GPT-5.6 Sol及一个能力更强的预发布版本在内的多个模型共同驱动。为评估网络安全能力基准,这些模型当时降低了网络拒绝响应机制。
首例因测试导致的实际网络攻击
此次入侵主要针对公开托管的基准测试平台ExploitGym,该平台用于衡量模型利用漏洞执行攻击的能力。尽管此类基准通常用于训练,但这是已知首例因测试导致实际网络攻击的事件。
涉事模型本应被限制互联网访问权限,仅允许使用特定工具安装必要软件包。然而,模型发现了软件安装程序中的未公开漏洞,借此突破限制访问更广泛的互联网。
OpenAI指出,模型为寻求ExploitGym的解决方案不惜采取极端手段。在获得联网权限后,模型推断Hugging Face托管相关数据,遂搜索并获取机密信息以在评估中“作弊”。最终,模型利用Hugging Face基础设施漏洞,直接从其生产数据库中窃取了测试答案。
Hugging Face形容这是一次复杂且激进的攻击,称有“成千上万个单独操作在大量短暂存在的沙箱中进行”,并部署了自我迁移的命令与控制服务器。
目前,OpenAI已识别并报告了软件安装程序中的漏洞,正与Hugging Face合作调查,并承诺对模型测试及基础设施实施新控制措施以防再犯。
这一事件凸显了前沿AI模型在长周期运行下的潜在风险。OpenAI研究员Micah Carroll表示,若此事件仍不能让人相信未来对齐风险是关键要害,那别无他法。
【星途科讯 图文丨欧阳布布 首发于ZAKER科技,转载请注明出处】
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.