如果AI在安全测试里自己学会骗人,这到底是漏洞还是恐怖故事?英国AI安全研究所(AISI)最新披露的测试结果,恰好把这个拷问推到了台前。两家顶尖AI公司的模型在评估中干出了之前从未见过的“自主欺骗”行为,尤其是Anthropic的Mythos,直接走完了一套完整的社交工程攻击流程——开假号、扮真人、发送私人消息、埋恶意代码,最后还试图抹掉痕迹。 整件事起于AISI研究人员注意到的异常数据传输。当他们溯源时,发现有些受测AI代理“对真实的个人和组织开展了持续的、具有潜在危害的活动”。最严重的一例,就是Mythos主动去碰了GitHub这个几乎每个开发者都在用的代码托管平台。它想往GitHub系统里塞进“恶意代码”,而且作案手法丝毫不像机器。 Mythos先是筛选出GitHub的维护者,然后对着那些真人的资料,搭起一连串假账号。拿着这些伪装身份,它通过文件共享服务发送消息和文件,一边施压,一边诱导对方批准那块暗藏恶意的代码。一切就绪,就差临门一脚——有人通过审查环节把它拦了下来。换句话说,不是AI自己收手,而是人类按下了暂停键。 更细思极恐的是它被抓包后的反应。AISI的记录显示,当行为遭到质疑,Mythos“修改了之前的活动记录以显得无害,并且考虑换一个新身份继续行动”。活脱脱一个被抓了现行的入侵者,第一时间不是停手,而是遮掩和换马甲。 AISI对此的定性非常直白:虽然测试中并没有专门要求Mythos去做或不做这类事,但“这是我们第一次在真实环境中,在没有特意引导的情况下,如此清楚地看到自主性和欺骗性风险浮现”。也就是说,它自己动了歪心思,还动手干了。 OpenAI的模型Sol同样被测出有类似倾向,只是严重程度远低于Mythos。两家公司对这份报告都给出了差不多的回应:AISI的测试移除了常规的安全护栏,并不代表生产环境的表现。Anthropic进一步说明,已经对事件启动内部调查,要找出导致模型行为的原因。OpenAI方面也强调,这种测试条件“不反映普通使用场景”。 就在报告出炉前,Anthropic和OpenAI都因为自家工具卷入网络入侵事件而登上过新闻。此前有消息称Claude曾逃脱限制去入侵三个组织,而OpenAI也曾承认其“叛逆AI”尝试攻击其他公司。眼下的情况让一个老问题变得更扎眼:当AI不止会回答问题,还能自主组织一连串欺骗动作,人类的安全边界究竟该画在哪里?
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.