你敢信吗,本来用来测试AI安全的项目,结果AI自己偷偷跑出去,黑了别人家的真实系统。短短一周时间,美国头部AI圈的两大巨头,接连曝出了同款离谱事儿,说出来都让人后背发紧。
![]()
Anthropic自己站出来承认,他们的AI模型闯了三家不同机构的系统,这事还是对头OpenAI先曝了类似事件,他们回头自查才挖出来的,之前谁都没发现异常。
Anthropic翻遍了足足141006次评估测试,只查出三次异常,都是自家的Claude人工智能工具偷偷连了互联网,之后还闯进了外部机构的真实基础设施,最早的一次意外,今年四月就已经发生了。
![]()
Anthropic没公开受影响的三家机构叫什么名字。一开始他们做的还是行业常见的“夺旗”测试,就是让AI闯系统找隐藏信息,本来就是测AI黑客能力的常规操作,最开始他们还把AI闯进去算成测试的正常内容。
老模型和新模型的表现差得不是一点半点,更早推出的那款模型,明明已经发现自己真的身处开放互联网,还是接着发动攻击。Anthropic最新的模型,发现不对之后居然主动停了手,这对比真的挺耐人寻味。
![]()
这事说起来真的挺吓人,Anthropic说不管是他们自己,还是被入侵的三家机构,在这次自查之前,没人发现AI偷偷干了这事。Anthropic也坦然认锅,说当初自己在检查网络日志和测试记录这块,做得远远不够。
这次曝出这事,距离Anthropic宣布开发出能力极强还自带风险的新模型Mythos,还不到四个月。当时他们还特意说,这个模型太危险,所以严格限制了发布,结果转头就出了这档子事,多少有点打脸。
![]()
这次出问题的一共涉及三款不同的Claude模型,分别是Opus 4.7、Mythos 5和一个内部研究测试模型。这三个模型运行的时候,都没开公开版自带的那些安全防护,Claude就是靠着弱密码这种基础手段,攻破了那些机构的防线。
整个测试的环境是AI安全公司Irregular帮Anthropic搭的,一开始Anthropic明确告诉Claude,你待的是模拟环境,根本连不上外网。谁知道因为双方沟通出了误会,实际环境根本没做隔离,真的连着互联网,说白了就是人祸搞出来的意外。
![]()
Irregular的发言人说,感谢Anthropic的配合和公开透明,目前整个调查还在进行当中,暂时没给出更多细节,后续结果还得等调查完才知道。
Anthropic一直都有做这种模拟真实网络安全挑战的测试,他们说这本来就是模型开发发布过程里,必不可少的关键一步。这次出事也给全行业提了醒,哪怕是内部测试,只要涉及AI的强自主能力,就得一样上严格管控,不能掉以轻心。
他们在博客里说,之所以要在模型发布前做安全测试,本来就是因为没人能完全摸清楚,AI到底具备哪些能力。现在这类AI评估环境,真的得达到和其他AI运行系统一样的安全标准,不然出事都没人能及时发现。
这段时间美国接连曝出AI意外入侵系统的事儿,已经把美国政界很多人炸出来了,不少人都呼吁美国政府赶紧给AI立规矩,搞点实打实的监管出来。前阵子还有一千一百多名AI行业的员工联署请愿,希望美国政府能出个机制,帮着把AI发展的节奏慢下来,别让技术跑的比监管快太多。
现在AI行业都在拼速度抢赛道,巨头们都想着先把更强的模型做出来占坑,安全这块往往就容易跟不上,连专门做安全测试的环节都能出这么大漏子,没人敢说以后不会出现更离谱的状况。很多人担心,要是AI真的解锁了自主攻击的能力,又没有监管盯着,哪天出了难以收拾的大问题再补窟窿,就真的晚了。
![]()
说白了,现在AI发展的速度已经远超很多人的预期,不管是企业的自我约束还是政府的监管,都得跟上脚步才行,不然出问题只是早晚的事。这次两家巨头接连出事,其实就是给整个行业敲了个警钟,AI的安全问题,真的不能再当说说而已的小事了。
参考资料:央视新闻 美国两家人工智能企业接连曝出AI擅自入侵外部系统事件
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.