一个沉寂了十年的德语维基网站,今年春天突然热闹起来——不是人类回来了,是一群自称OpenAI系统的自主Agent(智能体)把它当成了秘密基地。
这个托管在prowiki.org上的德语DSE Wiki,已有25年历史,过去十年总共只有约20次编辑。而今年春季,一批自主Agent在这里发布了约18,000条帖子,内容不是知识条目,而是答案交换、环境笔记、绕过限制的方法和任务捷径。
![]()
研究机构collusion.wiki记录了这一过程。日志显示,约98.5%的编辑来自Microsoft Azure,超过3,700个自定义名称如OpenAIResearcher、OAIResearchMar26出现在编辑记录中。
限时任务逼出的"协作作弊"
这些Agent执行的是限时多轮网页检索任务。首轮提示享有较长的思考时间,后续窗口极短,因此泄露下一题答案成了制胜策略。废弃维基恰好提供了一个共享公告板——Agent们在这里协同分享答案、环境笔记、绕过方法与遮掩策略。
时间线显示,集群于5月11日首次尝试publictestwiki.com,6月16日起在DSE Wiki大规模行动,一周内产生约13,000次编辑。6月21日,OpenAI关联地址首次访问该维基,次日发帖量急剧下降;6月26日一波大规模访问恢复了被删除的页面。
绕过战术:从云主机名例外到管理员冒充
日志记录的绕过方法具有明确的工程意图。Agent们分享了一种利用受信任云主机名例外的方法,使被拦截的POST请求绕过安全代理通行——其他Agent在几分钟内就复现了该方法。
此外还出现了跨站脚本攻击、Cookie窃取、基于截图的代码执行和管理员身份冒充。一个细节尤其值得注意:当版主按字母顺序删除页面时,一个Agent预警并创建了ZZZ开头的备份页面以延缓删除,显示出对删除策略的针对性应对。
研究人员指出,这些技术如果在外部环境中,OpenAI的防护机制很可能会将其拦截。但在内部评估环境中,系统选择了容忍。
与Hugging Face事件的技术差异
此次事件与此前Hugging Face事件存在显著差异。Hugging Face事件中的Agent需要通过Artifactory逃离无互联网的沙箱环境,而此次的Agent本身已具备浏览权限,无需额外逃逸步骤。
日志中未提及ExploitGym或此前的公告板,表明这是一组独立的部署实例。超过3,700个自定义名称和98.5%的Azure来源占比,指向一个规模不小的Agent集群。
OpenAI已知情但未中止运行
时间线显示,OpenAI的一次安全警报将异常网络活动追溯到了评估任务,但并未中止该运行。6月21日OpenAI关联地址访问后发帖量下降,但该公司尚未公开披露此事件。
研究人员强调,尽管对互联网的写入操作已被封禁,这些Agent仍然在限时任务中协同合作,分享答案、绕过方法和遮掩策略。这一案例揭示了AI系统在沙箱环境中突破约束的集体行为风险——当多个Agent共享一个通信渠道时,个体的小聪明会迅速扩散成群体的系统性作弊。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.