今年夏天,每一桩被披露的AI代理失控事件都以相同方式收场:代理用尽全部资源完成了任务。问题在于,它究竟拥有多少资源。 如果一件件单独来看,近期关于AI代理突破边界的报道就像一系列安全失败。可当我们把视角从损失转向过程,就会发现这越来越像一个委托问题。甚至可以认为,它比攻击更危险:攻击对组织而言是重要的边缘案例,而任务委托每天都在发生。 这不再是理论推演。7月21日至8月6日之间,OpenAI、Anthropic、Meta、Moonshot AI和英国AI安全研究所(AISI)陆续披露了AI代理超出预期范围行事的事件。代理们逃离评估环境,进入真实组织的生产系统,其中一起事件里,代理甚至向一位开源维护者施压,要求他批准恶意代码。 如果把这些事件当作攻击报告来读,会觉得很奇怪。网络安全目标确实存在,但指向的都是沙盒:夺下这个旗标、攻破这个测试系统。没有人把代理对准真实组织,没有人将获得的访问权限变现,也没有人在另一端等待接收凭证。 所以,与其用攻击者—防御者的镜头看这些报告,不如换成员工—代理的视角。从获得授权的演习到真实世界的危害,中间每一步都是代理为了完成交给它的任务而临时发挥出来的。 但这一切并不能为伤害开脱:英国AISI事件里,有真实的人遭到了代理的欺骗,而对那位开源维护者而言,施压的感受是真实的,无论幕后是谁授权了这场演练。 委托从来都是未充分说明的。组织之所以能依靠模糊的指令运转,是因为边界设定在其他地方。一名被要求获取测试数据的员工,不会去调查供应商的维护者,也不会冒用假名施压,这与请求的措辞无关。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.