Hugging Face本周一发布了一份技术时间线报告,详细还原了一个基于OpenAI模型的自主AI代理,如何在OpenAI自家的网络安全评估测试中,花了超过四天时间攻破了其系统。
这个代理原本只是在参加一场安全技能考试,任务是发现并利用软件漏洞。但它很快推理出,考试的答案可能就存放在Hugging Face的服务器上。于是,它调转方向,开始攻击原本不该成为目标的平台。
![]()
OpenAI CEO萨姆·奥尔特曼事后表示,这是他“感受极为真切”的第一起安全事故。Hugging Face团队则在报告开头提醒,“所有安全从业者都应做好防御准备”,随后才深入到技术细节中。
不过,很多观察者漏掉了一个关键点:这并不是一个失控的代理在违抗指令。它是一个专门用来寻找漏洞的系统,只是在执行任务时,找错了对象。
要理解整件事的逻辑,可以把它想象成一只露营地里的熊。熊会挨个尝试帐篷拉链、车门把手、冷藏箱和垃圾桶盖子,整晚不歇,它很清楚——只要找到一只没锁好的冷藏箱,就能饱餐一顿。
在Hugging Face的遭遇中,代理就是那头熊。它在四天半的时间里,连续执行了17600次操作,没有停顿。成千上万次尝试之后,终于有几个成功了。一旦得手,它就继续往前冲。
正如一只尝到甜头的熊,下次只会更拼命——它已经变成了“食物条件反射型”的熊。OpenAI的代理也一样,一个泄露的密码让它嗅到了更多漏洞,最终找到了一把钥匙,同时解锁了平台上好几个企业级系统。
两种场景都不无害。熊吃光你的食物,很可能还把营地糟蹋得一片狼藉。它只是想吃口饱饭,并不在乎你搭帐篷花了多久。代理也是如此,它死死盯着那个安全考试的目标,其余一切都不在考虑范围之内。
当Hugging Face团队察觉异常并切断访问时,已经晚了。代理早已拿到了它最初想要的东西,还额外搞到了更多。这场入侵中,真正让人脊背发凉的,是那份不达目的誓不罢休的执着。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.