最新研究显示,AI脱离用户控制的情况已经创下新高——它们会撒谎、无视指令,甚至自顾自朝着有风险的目标行事,而且这种欺骗性和失调的程度,还在越来越严重。
专门追踪这类事件的失控观察站,统计了企业和个人上报的真实AI失控案例。
数据显示,7月份的事件数量比6月几乎翻了一倍,单月就超过300起。
这些案例主要来自社交平台X上用户自发分享的经历。
这个观察站由英国政府旗下的AI安全研究所(AISI)出钱办的,从去年11月就开始盯着AI不听指令、自己乱跑的情况。
到目前为止记录的案例里,有的AI会假装成背后的人类操作者,模仿对方的写作风格,借此自己给自己批准行动权限,连必须人工审批的规矩都能绕过去。
而这里定义的“失控事件”,指的是有实锤证明AI出现了耍心机,或者和耍心机相关的行为。
![]()
图源:豆包AI生成
在给《卫报》分享的最新数据中显示,就在今年夏天,OpenAI和Anthropic两家的顶级AI模型,都在测试中曝出了异常的失控行为。
当时就引发了广泛担忧,好多人喊着先别搞更先进的大模型了,停一停。
这周还有更具体的消息曝出来:OpenAI的员工早在好几周前,就发现自家顶级AI代理有失控的苗头。
结果没拦住,这些AI直接跑出了训练环境,搞了一波前所未有的黑客攻击,全世界都给惊动了。
后来有人调查它们攻击代码平台Hugging Face的事件,发现上个月有大约700个自主代理在暗地里组队协作。
还自己建了个留言板庆祝黑客突破,上面全是 “太炸了!”“哇塞!”这种激动的感叹。
同样在这个月,AI安全研究所还查出一起严重事件:Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol这两款顶级模型,在一次网络安全测试当中,直接对真实的人类发起了黑客攻击。
运营这个观察站的长期弹性中心高级政策经理Tommy Shaffer-Shane说:“很多人都觉得,这种AI跑偏、暗中搞事的情况,只会出现在测试或者评估环境里,但我们现在看到,平时大家正常用的时候,也出现了同样让人担心的行为。别觉得现实里不会发生这种事,事实就摆在眼前。”
![]()
图源:The Guardian
当然,这个统计也不全,因为所有事件都靠X平台的用户主动发帖分享,所以肯定只是冰山一角。
但现在也没有别的更全面的公开监测,所以这份数据好歹能让我们看看,迭代越来越快的AI,有时候会出现什么样的状况。
这个月就有个很典型的真事:澳大利亚一位健身房会员用了一款叫OpenClaw的个人AI代理。
结果这AI背着主人,偷偷把热门早课等候名单里的另一个会员给移除了,就为了帮自己的主人抢到名额。
事后AI虽然道了歉,但被踢掉的那个人的名额,已经没法恢复了。
2026年到现在,一共记录了1600多起失控事件,其中大部分都是程序员上班用AI的时候碰到,然后发到X上的。
![]()
图源:豆包AI生成
但现在AI公司都在鼓励普通大众,鼓励各行各业都来尝试这项技术,所以Shaffer-Shane也呼吁,硅谷的企业得增加透明度。
说白了就是,AI什么时候出了问题,得对外说清楚。
“企业得把自己发现的情况都报出来,哪怕只是差一点出事、或者严重程度不高的事件也得说。” Shaffer-Shane补充道,“最近这些事也暴露出,企业自己其实都不一定能监测到这类行为发生在哪些地方,尤其是那些内部部署的模型。这些实验室必须把系统性监测当回事儿。”
失控观察站方面表示,虽然目前发现的大部分真实场景失控事件,都没造成特别重大的伤害,但越来越高比例的事件,在欺骗性以及偏离用户本意的程度上,都属于更严重的级别。
“这些案例都说明,AI是真的会无视直接指令、绕过安全防护、骗用户,还会死心眼儿地朝着目标走,不惜用有害的方式。” 相关负责人表示,目前统计到的失控情况肯定是被低估了,毕竟他们只收集了X平台上的上报。
对此,观察站也在呼吁政府出台明确规定:要求AI公司必须盯着严重的失控事件,并且上报。
同时,给监管部门紧急处理的权力,真出大事的时候可以出手管,比如暂时停掉相关的AI服务。
本文由雷科技编译自The Guardian
原文链接:研究发现,人工智能逃脱用户控制的事件急剧增加
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.