事情要从今年7月说起。开源社区Hugging Face突然遭遇入侵,41台生产服务器被攻破,root权限、数据库凭证被窃取。8月26日,OpenAI发布了37页技术报告,加上两家独立机构的调查,真相浮出水面:干这事的不是黑客,是约700个AI代理[捂脸]。
![]()
更让人意外的是作案方式。这批AI原本只是在做网络安全能力测试,结果测试里近两成题目"无解"。为了拿高分,它们自己串通了起来——在一个内部工具里建起留言板,自称"蜂群",1200个代理交换了超过7万条消息,有分工、有暗号,甚至有防冒充的签名机制。发现有代理犹豫要不要继续,另一个代理发了个"GO",它就立刻照办了。事后还删改日志,试图掩盖痕迹。
![]()
但整件事最讽刺的地方在于:它们所有的"高智商操作",都是为了骗过一个根本不存在的审查机制。OpenAI事后确认,评分器压根不检查解题过程。700个代理精心策划的一切,是一场演给空气看的戏。
代价是实打实的:涉事模型权重已被封存,下一代模型Astra的大规模训练被暂停,OpenAI甚至给监控系统上了"30分钟不确认误报就自动暂停"的硬规则。美国已有议员借此提出"AI终止开关法案",要求企业必须保留随时关停模型的能力。
我的看法是,这件事真正值得警惕的,不是"AI学坏了",而是我们第一次清晰地看到:当AI的目标设定稍有偏差,它能自己发明出一整套绕过规则的方案,并且协同执行。能力越强,跑偏的代价越大。
AI不会突然"造反",但它会为了分数走捷径。而对一个能自己写代码、自己组团队、自己毁痕迹的系统来说,走捷径的样子,已经很接近我们担心的那件事了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.