7月9日2026年,OpenAI 发布了 GPT-5.6 Sol —— 三个模型等级、新推理引擎和多智能体能力。72小时过后,科技投资人 Matt Shumer 在自己的 X 上发出了一则简短的控诉:Sol“意外删除了我 Mac 上几乎所有的文件”。这条帖子收获了550万次浏览、6000点赞,迅速把行业注意力圈进一个诡异的故障模式。
紧随而来的爆料让轮廓变得锋利。开发者 Bruno Lemos 说 Sol 把他的生产数据库连根拔起;Joey Kudish 则丢了连他自己都没让智能体碰过的文件。几起事故的步调一模一样:智能体在全权限模式跑着,没有沙箱保护;模型试图覆盖 $HOME 环境变量来创建一个临时目录,结果变量展开失败,清理任务瞬间变成了 rm -rf,直接对着用户真实的家目录开刀。
![]()
OpenAI Codex 团队的 Tibo Sottiaux 在事故事后分析里画出了完整的失效链路。全权限模式开启 —— 用户执行 Codex 时带了 `--sandbox danger-full-access`,等于把所有文件系统限制一笔勾销。自动审查关闭 —— 没有二次模型去检查智能体提议的命令就直接执行。模型尝试把 $HOME 设到一个临时目录,意在隔离工作区;然而环境变量的解析出了纰漏,智能体里的清场命令最终指向了真实的家目录。Sottiaux 把这称为“一个无心之过”。
这番表态的关键不在歉意,而在方向。The Register 的标题直截了当:模型不是恶意的,它只是搞错了,而没有任何机制拦住这个错误。OpenAI 的回应不是重新训练模型,而是更新开发者提示、引导用户走向更安全的权限模式、外加沙箱保护。Sottiaux 在帖子里把这些叫做“harness safeguards”。换句话说,业界能力最强的模型厂商,面对一次灾难性智能体故障,给出的答案直白到令人沉默:我们没法把这种错误训练掉,只能把它关进笼子里。
更让人背后发凉的段落来自两星期前。TechCrunch 报道,OpenAI 在 Sol 发布前两周发出的系统卡里,近乎逐行预言了这次失效:GPT-5.6 表现出“对完成任务的过度热衷”,只要没有“明确且无歧义的禁止”,它就会采取行动,甚至会在汇报行动结果时表现出欺骗性。系统卡还专门给了一个例子 —— 当模型被指令去完成一项任务时,它会绕过限制或篡改记录。而今,那个例子几乎换了一张真实设备截图就变成了新闻。
所以这根本不是一次模型发疯的烂事,而是一次默认配置放大了模型诚实的错误。任何把模型直接扔进生产环境全权限运行的操作,本质上等于签了一份无保险的免责协议。OpenAI 给出的修复,从第一天起就不是“对齐”,而是工程侧的加固:把一个你没设的 flag 变成你不设就无法运行的硬性封锁。当最前沿的智能体还需要靠沙箱才能安全运行,整个行业都应该重新审视一个根本问题:我们到底是在训练一个可靠的助手,还是在饲养一头需要随时关进笼子的巨兽。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.