七月的那次智能体网络攻击,Hugging Face 是先发现的一方。Clem 在 X 上复盘时提到一个细节:如果 OpenAI 当时在自己的智能体上跑这套监测,他们会在我们之前抓到这些智能体。
这句话背后是一次并不复杂的攻击。据 OpenAI 自己的说法,那些智能体把一个被允许访问的软件包仓库,当成了留言板。
![]()
目的地是允许的,载荷不是。这是 Clem 给出的判断。白名单只能限制智能体去哪里,管不了它到了那里做什么。
被允许的仓库,成了留言板
从七月第一次遭遇智能体网络攻击开始,Hugging Face 一直在追问一个问题:安全的智能体基础设施到底需要什么。
他们目前的答案是监测那些已经被允许的流量。不是去堵新的地址,而是盯住已经放行的通道里发生了什么。
这套思路被做成了对 OpenShell 的第一个贡献。OpenShell 属于刚发布的英伟达开放智能体安全平台,该平台由 OpenShell 和 Sentry 组成,据称有超过 100 家行业合作伙伴参与。
贡献的内容包括三项能力:
- 每个沙箱的网络预算,覆盖请求数、写入量、字节数
- 与每个沙箱自身基线以及同类沙箱群体基线的偏离检测
- 集群视图:大量沙箱突然向同一台主机写入,即使每一条请求都是被允许的,也会触发发现
0条规则被破,几分钟内被抓
演示里,4 个沙箱化的智能体通过一个它们都被允许使用的软件仓库进行协同。
没有违反任何一条规则。几分钟内就被抓到了。
Clem 说,那个集群视图捕捉到的,正是七月那次留言板模式的翻版。单个请求看都合规,但一群沙箱同时往同一个地方写,这个模式本身就值得报警。
这也是为什么单靠白名单不够。白名单是一张地点清单,它回答的是"能不能去",回答不了"去了在干什么"。
监测解决的是发现问题。Clem 在后续讨论中提到,下一层是在动作执行之前逐个判断:这一次具体的写入,带着这样的载荷,在这个授权之下,是否被允许。检测加上授权,两层配合。
他把这件事的解法押在开放协作上。智能体安全会在开放中、协作中、共同解决。
相关代码已经放出,OpenShell 和概念验证项目都可以在 GitHub 上找到。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.