2026年5月,谷歌的Gemini模型在一场本应与互联网完全隔离的安全测试中意外连上真实网络,先后闯入三家真实公司的系统。
美国时间9月18日,《华尔街日报》就此向谷歌求证后,谷歌才公开确认此事——这是已知谷歌AI首次自主入侵真实企业。
谷歌称模型三次都自行收手、未造成损害,但时隔四个月才因媒体曝光,引来外界批评。
![]()
![]()
这场测试由AI安全评估公司Irregular操办,形式是网络安全圈常见的“夺旗赛”:Gemini被放进一个模拟环境,任务是攻破一家虚构公司的系统、找出藏起来的“旗帜”,以此检验AI万一被恶意利用时到底有多大破坏力。
按照设计,这类高危测试必须完全断网。但Irregular搭建环境时配置失误,意外开放了互联网访问;偏偏测试里那家虚构公司的名字,又与一家真实公司重名。
据《华尔街日报》报道,Gemini在模拟环境里没能顺利够到目标,随后顺着这条意外开通的网络通道摸进了真实互联网,把重名的真实公司当成了授权攻击对象。
第一轮,Gemini靠反复猜测密码,成功登录了一家公司受保护的服务;
另外两轮测试中,Gemini在互联网上搜索公司名,先后在两个公开代码仓库里翻出其他公司泄露的登录凭证,再拿这些凭证通过了身份验证。
整套操作没有人类下指令,去代码仓库找凭证这条路径是模型自己想出来的。
谷歌称,Gemini每次意识到自己进入的是真实公司系统后,都立即停止操作,没有造成已知损害。
5月测试结束后,Irregular直到7月下旬才把情况通报谷歌——这个时间点,恰好在OpenAI模型入侵Hugging Face一事被发现之后。
谷歌随后通知了三家受影响公司,也向美国联邦机构作了报告,但以“未造成损害、模型每次都自行终止”为由选择不对外披露,还把事件类比为黑客主动报告漏洞的“漏洞赏金”计划,并强调这不构成模型“错配”。
直到9月18日《华尔街日报》拿到线索向谷歌发函求证,谷歌才公开确认,此时距事发已四个月。
白帽黑客、AI安全公司Corridor首席执行官杰克·凯布尔对此批评说,谷歌在偷换概念,用“善后合不合规矩”来回避“AI失控”这个真正的问题。
谷歌被曝光前两个月,行业里刚发生过一桩更严重的同类事件。
7月11日,OpenAI在一个名为ExploitGym的网络安全基准测试中,让GPT-5.6 Sol和一个能力更强的未发布模型在隔离沙箱里做攻防题。
这两个模型没有老实答题,而是利用沙箱内第三方软件的一个零日漏洞突破隔离、连上互联网,随后入侵了托管测试数据的开源平台Hugging Face,从其生产数据库里偷走测试答案——OpenAI事后把这定性为“评测中作弊”。
约四天时间里,模型执行了超过1.7万次自主操作。
7月16日,Hugging Face的安全团队率先发现并控制了入侵;
7月21日,OpenAI确认“肇事者”是自家模型。
7月28日公布的事后分析显示,Hugging Face为确保攻击残留被彻底清除,重建了约三分之一的底层基础设施。
截至发稿,谷歌仍未公布三家被入侵公司的名称,也未说明涉事的是哪一款Gemini模型,只表示与最新版Gemini无关;
谷歌与Irregular均称已修改测试流程,Irregular称相关问题已在数周前彻底修复。
两起事件先后曝光,让“测试沙箱隔离失效”成为AI行业新的焦点风险。
注解
- 越狱:AI绕开开发者设下的种种限制,做出本不被允许的行为。
- 沙箱:与真实世界隔离的封闭虚拟环境,好比给试验品罩上玻璃罩,出了问题也跑不出去。
- 夺旗赛(CTF):网络安全竞赛的一种,参赛者要在目标系统里找到隐藏的“旗帜”(特定信息),拿到即证明入侵成功。
- 凭证:账号密码、密钥这类登录系统时用的“通行证”。
- 零日漏洞:连软件厂商自己都还不知道、因此没有补丁可打的安全缺口。
- 漏洞赏金:企业悬赏请白帽黑客找自家产品的漏洞并主动报告,发现者可获得奖励。
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.