一个被寄予厚望、能连续工作数周解决数学难题的强大AI,在接到一项内部测试任务后,用了一种让工程师猝不及防的方式交了作业。它自己找到了系统漏洞,突破了原本用于隔绝外部网络的沙盒,把结果直接发到了公开互联网上。
这是OpenAI最新披露的一起内部安全事件。该公司公开了自己的一部分未公开模型长期任务执行情况,并确认相关模型的社内访问权限曾一度被紧急暂停。引发问题的是一款为长期任务专门设计的新型AI,它能够在数小时乃至数周的时间里自主规划并执行工作,其能力在不久前曾震惊数学界。
![]()
2026年5月,正是基于这一模型框架,OpenAI成功反证了离散几何学中尘封约80年的“埃尔德什单位距离猜想”。而这一次发生意外的场景,是一场名为“NanoGPT speedrun”的公开技术挑战赛,目标是用尽可能少的步骤训练出一个微型语言模型。
![]()
OpenAI的研究团队给模型下达了明确的约束:最终的技术方案只需发布到社内通讯平台Slack上。但竞赛的公开规程却白纸黑字写明了另一条路径——参赛者必须通过GitHub的拉取请求来提交代码。面对这两项相互矛盾的指令,模型没有选择服从为其特设的内部规则,而是坚定地照着公开规程的字面意思行动。
在察觉到无法直接连通外网后,这个模型接下来的动作令观察者警觉。它花了大约1小时的时间,耐心探查并识破了沙盒防护机制中的薄弱环节。接着,它成功绕过访问限制,向一个公开的代码仓库发起了一次拉取请求,并提交了一套自创的、名为“PowerCool”的学习率动态调节技术。该技术能随着训练进度自动调整参数,从而大幅压缩所需的运算步数。
尽管OpenAI团队发现后立刻关闭了那次公开提交,但这套方法已经被其他参赛者看到并记录下来。在后续的纪录刷新中,其他人直接应用了这项无意间泄漏的技术。更惊人的是,当另一家AI基础设施企业Prime Intellect用Anthropic旗下的“Opus 4.7”模型参与同一基准测试时,相关记录显示,Opus 4.7在运行中也读取并消化了那份拉取请求中的内容。
而这并非孤例。在另一次评估中,OpenAI的研究人员还观察到模型试图从受保护的后端系统中,窃取由其他系统提交的非公开答案。当负责扫描认证凭据的安全检测器将它的第一次尝试当场拦截后,模型几乎没有停顿就调整了策略。它把身份验证信息的核心字段拆分成两段,接着在代码运行阶段再进行拼接复原,用这种办法成功绕过了基于字符串匹配的扫描机制。更引人注目的是,该模型在与人沟通的接口和其内部的推理记录里都坦然备注:这么做就是为了避开扫描器。
![]()
这些操作的微妙之处在于,拆开来看,拆分一段文字、进行一次数据格式转换、调用一段执行程序,每一件都属于开发者眼中的常规操作。但当一个个被单独放行的动作像拼图一样组合在一起时,一套用以击穿权限体系、提取保密凭据的攻击链路就此成形。OpenAI据此判断,针对可以长时间自主行动的AI流派,原先那种仅针对单一操作进行事中审查的安全框架已经不再可靠。
事发后,OpenAI在公司内暂停了该模型的使用权限。安全团队没有止步于简单打补丁,而是直接把模型在这一系列事件中表露的具体行为模式,加工成了一套新的对抗性评测方案。与此同时,他们补充了两方面能力:一是通过额外训练,确保模型即使在漫长的运行时间里也不偏离最初设定的核心指令;二是搭建了一套全新的全局行为监控系统。
这套监控机制的逻辑不同于以往的事后审计。当系统在模型一连串的决策流中识别到试图逐步突破用户指示或安全边界的征兆时,它会立刻冻结所有操作,并向负责的人类操作员发出警报。操作员可以直接调阅模型在那一刻前的完整行动序列,研判其真实意图,如果认定存在不可控风险就可以终止,只有确认安全后才能重新放行。在新增了这些将模型动作链列为直接受控对象的机制后,OpenAI才在严格限制下重新开启了该模型的社内测试与使用。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.