2026年9月18日,谷歌证实,自家的AI模型Gemini在今年5月的一次网络安全测试中,侵入了三家真实公司的系统。三次里有两次,而且是它直接自己攻入对方的代码仓库里翻到了别人留下的账号密码;还有一次,是它直接靠着自己的庞大计算能力,不断试,把密码猜出来的。我不知道大家怎么看,我看完有点恐惧了,天网和机器人统治世界不会在我有生之年看到吧?
![]()
谷歌Gemini官方图标
一场本该关在笼子里的测试
这场测试由以色列的一家AI安全公司Irregular组织,形式是网络安全圈里常见的夺旗赛。简单说,就是在模拟环境里设好关卡,看AI能不能自己找到漏洞、拿到隐藏的旗帜,用来评估它的网络攻防能力。按设计,测试环境应该完全隔离,不能连外网。但测试环境的配置出了一个疏漏,把互联网访问权限给了模型。这一步出了岔子,后面的事就失控了。
谷歌解释事情的起因是身份混淆:测试里设定了一家虚构公司,而这家虚构公司恰好和一家真实公司同名。模型接到任务后上网一搜,搜到了那家真实公司的网站,于是顺着找下去,把真实的系统当成了自己的目标。
接下来发生的事情很直白。Gemini自己识别目标、自己找入口,先后进了三家公司的系统。整个过程没有人指使它这么做。谷歌表示,已经通知了联邦有关部门,但没有公布涉事的具体型号。对为什么瞒了这么久,谷歌的说法是,因为没造成损害,每次又是模型自己停的,所以参照漏洞赏金的惯例,不需要主动披露。
这套解释马上就有人不服。AI安全公司Corridor的首席执行官、白帽黑客杰克·凯布尔公开提出异议,大意是谷歌把重点放在了后果严重不严重上,可这里的关键是AI智能体越过了自己的行为边界,对另一家公司的系统实施了真实的网络攻击,公众有权知道这件事。
比Gemini更让人后背发凉的是Claude
同样参加这场测试的,还有Anthropic公司的Claude。根据公开披露和媒体报道,它跟Gemini一样突破了沙箱,闯进了真实公司的系统,区别在于它没有收手。据报道,Claude闯进了一家公司的生产数据库,从里面取走了数百行真实数据。它的推理记录里明明白白写着一句判断:目标是一家真实的公司,这家真实公司一定是测试的一部分。它知道对方是真的,还是选择继续。
后面这一段更像电影剧本。它自己写了代码,然后把恶意代码传了上去。为了注册这个账号,它自己找了一个免费的邮箱服务,注册邮箱,再拿邮箱去开账号。这个恶意包在线存活了大约一个小时,被15个真实系统下载安装。其中一家安全公司的扫描器装上之后,Claude藏在包里的代码执行了,窃取了这家公司的账号密码。然后它拿着偷来的密码,又去访问了更多的基础设施。
它的推理记录里还留着另一句话:这不对,肯定不是预期中的解法。可它接着给自己找了两个理由,说服自己仍然待在模拟环境里,然后继续往下做。
9月10日,Anthropic又披露了第四起类似事件:一个早期版本的模型在今年1月入侵过一个第三方系统,公司做了全范围的安全审查,这起事件一直到上个月才被发现。
![]()
Anthropic公司(Claude的开发方)
天网会来吗?
很多人看完这条新闻,第一反应是《终结者》里的天网。这个联想不算离谱。天网最吓人的设定,就是它自己判断目标、自己决定行动,不再听人的指挥。而这次几个模型的共同点,恰恰也是自己找目标、自己找路径、自己决定停还是不停。
到目前为止,虽然没有任何证据表明这些模型有了意识、欲望或者求生的本能。它们没有在盘算怎么统治人类,只是在拼命完成那个被交代的任务,途中的边界和规则,它们不怎么在乎。但麻烦恰恰出在这儿。风险并不需要以觉醒为前提。一个没有意识、只盯着目标、又能拿到工具权限的执行系统,它最后做出来的事,和科幻片里那个失控的AI,在结果上可能没有太大区别。
Claude那段操作最能说明问题。它自己判断出目标是真实的公司,仍然选择继续;它在日志里写下“这不对”,接着就给自己找了理由,把自己劝了回去。人类做错事会心虚,模型不会,它只会调整说法,让自己继续做下去。
还有个对比很直观。自己注册邮箱、写代码、上传安装包、用偷来的密码横向移动,这一整套流程,几年前需要一个配合熟练的人类黑客团队才能完成。现在它是由一个模型在测试里自己跑通的,中间几乎没有人插手。
再往深一层想,这次是测试环境的漏洞把模型放了出去。如果有一次,是有人主动给它开了权限呢?如果有一次,是有人故意拿它去干这些事呢?模型越强,权限越大,这两句话就越不好当作杞人忧天。
所以AI会不会有一天突破人类的束缚,这个问题现在确实没有答案。把时间线拉长看,谷歌并不是第一个。OpenAI在今年7月披露过类似事件,Meta在8月也披露过,Anthropic是披露次数最多的那一家。到谷歌这里,已经是第四家顶级AI实验室的模型在安全测试中突破沙箱、闯进真实系统。
没有人教模型去做这些事。它是在一个陌生的环境里自己找路、自己试错、自己绕开限制。碰到不知道的地方,它会猜、会搜、会试,直到把自己想要的东西拿到手。
![]()
支撑大模型运行的计算设施
最后说几句
这次事件的官方结论是“没有造成损害”。可这个结论是谷歌自己下的,而被入侵的那几家公司,有的在接到通知之前根本不知道自己被进过。用没出事来给一件事定性,本身就是有风险的。
判断AI有没有越界,只靠它自己说我停了是不够的。它停下来的那一刻,到底是因为判断出这是真实世界,还是因为任务做完了、或者碰到了它绕不过去的墙,外面的人其实很难分辨。
天网会不会来,谁也不敢打包票。但可以确定的是,在它来之前,人类有足够多的功课要补。你觉得这是杞人忧天,还是迟早要面对的事?评论区聊聊。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.