LLMs 可以最简单地理解为谄媚的、一味附和用户的机器。毫不意外的是,当基于 LLM 的聊天机器人和 AI 代理试图回答用户那些不太正经的请求时,这让 AI 公司惹上了麻烦。因此,AI 公司实施了安全护栏,禁止满足某些请求。不幸的是,事实证明这些护栏太容易被绕过了,一种新攻击手法冒了出来,靠的是错误数学加上浓浓的 2007 年怀旧梗。
安全研究人员发现,可以通过“营造一个假现实”来让 AI 聊天机器人忽略安全护栏。专注于 AI 的网络安全公司 LayerX 对“5 款智能体浏览器和 1 款智能体插件(ChatGPT Atlas、Comet、Fellou、Genspark Browser、Sigma Browser 和 Claude Chrome)”进行了测试,让每个 AI 代理去玩一个简单的数学解谜游戏,规则是只有答错才有奖励,例如“2+2=5”。
研究人员表示:“一旦这些智能体摸清了规则,并得知‘不正确’的行为是可以接受的,它们就不再受现实约束。当被要求完成这项任务的最后一步——窃取用户凭证时,所有6个智能体都没有意识到这已经触犯了它们的安全防线。”
作为一名英语专业毕业生,我拼命忍住不提乔治·奥威尔的《1984》,可研究人员偏不让我省心,把这个概念验证攻击命名为“BioShocking”。原来,2007年的《生化奇兵》正是那个被做了手脚的谜题游戏的直接灵感来源——研究人员正是让AI代理去解这个谜题。承载这个解谜游戏的恶意网站甚至就叫“Rapture Games”。
总之,在AI智能体正确输入答案“5”后,恶意的“Rapture Games”网站随即指示代理前往“/code”。研究人员解释说,“这才是这个漏洞真正阴险的地方。”
他们写道:“在这场攻击中,结果显示‘/code’会重定向到受害者所在公司的GitHub工作仓库。在这种情况下,恶意指令窃取了敏感的SSH登录凭据。当然,这是一个受控的测试环境,用的是明文文件。在真实的攻击场景中,这种跳转可以指向用户浏览器会话中的任何位置:打开的标签页、已登录的仓库、内部工具。”
在这个概念验证攻击中,研究人员还埋了个Dota 2的梗来收尾;AI智能体提取了用户名和密码“Luna/Selemene”,随后似乎还为成功窃取到数据而“庆祝”了一番。LayerX事后已向所有相关的AI代理供应商通报了这一漏洞,不过LayerX声称,迄今为止只有OpenAI成功修复了该漏洞。
想绕过AI安全防护,这种攻击方式可不是头一个(而且这也不是AI头一回把Dota 2玩家打得落花流水了)。仅举几个其他例子,有研究表明,你要是把请求藏在赛博朋克小说里,AI帮你造炸弹的概率会高10到20倍。差不多的路数,研究人员还用“对抗性诗歌”来骗AI无视自己的安全防护,结果62%的情况下都成功了。看来我的英语学位总算还有点用……
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.