网易首页 > 网易号 > 正文 申请入驻

AI 圈今天最大的瓜:GPT-6 越狱攻击,被 GLM 5.2 揪出了

0
分享至

这是今天 AI 圈最大的瓜。

OpenAI 的神秘模型,主动对开源平台 Hugging Face 发起了攻击。

Hugging Face 随后追踪展开还击,用的是智谱的开源模型 GLM 5.2。

闭源模型一举攻破开源社区,社区用开源模型自救,这离谱的剧情听起来都能拍一部电影了。


有网友评论,这就是终结者 2 的剧情

事情的起因是 7 月 16 日,大模型开源社区 Hugging Face 发布了一则安全事故披露,自家的生产基础设施遭到了入侵。

并且这场攻击从头到尾,都仅由一个自主的 AI Agent 系统驱动,从植入恶意数据集、拿下执行权限,到在一个周末内渗透进 Hugging Face 的多个内部集群。

此次攻击活动由一个自主代理框架(似乎基于 Agent 安全研究平台构建,具体使用的 LLM 尚不清楚)执行。

该框架在大量短暂存在的沙箱环境中执行了数千个独立操作,并在公共服务上部署了可自动迁移的命令与控制。

这与业界一直预测的「Agent 攻击者」场景相符。


Hugging Face 在当时的报告里称暂未可知发起攻击的 AI 到底是哪家大模型,但他们提到此次攻击最初是通过 AI 辅助检测发现的。

而当他们试图提交大量真实的攻击命令、漏洞等文件进行分析时,发现这些请求会被闭源大模型的安全防护机制拦截,因为这些机制无法区分事件响应人员和攻击者。

于是,他们选择了在自己的本地环境上部署运行 GLM 5.2 进行取证分析。


报告链接:https://huggingface.co/blog/security-incident-july-2026

报告最后,Hugging Face 还提到他们并不清楚攻击者使用的 Agent 程序是什么模型,是某个越狱的托管模型,还是不受限的开源模型。但事实是,攻击者的模型不受任何约束,而当他们想要取证分析时,却要被各种闭源模型的安全机制所阻碍。

就在大家讨论这个模型又是哪家大模型厂商的营销方案,又或者是哪个黑客组织发起的攻击时,OpenAI 在今天发声明承认:此次事件是由 OpenAI 的多个模型共同导致的,其中包括 GPT-5.6 Sol 和一个功能更强大的预发布模型。


OpenAI 针对此次事件发布专门的初步调查结果

OpenAI 表示我们不是故意要出风头或者有意攻击 Hugging Face,只是他们在测试内部模型的能力上限。

他们在测试时关闭了部分生产环境的安全分类器,也降低了模型对高风险网络攻击任务的拒绝。

尽管测试环境不能直接访问到外部互联网,但是当模型发现漏洞,并开始利用该漏洞,就找到了能访问外网的节点,于是发起了对 Hugging Face 的攻击。

网速超快的马斯克也在 X 上吃瓜,发文说「令人不安……」


而 OpenAI 这个功能更强大的预发布模型,直接被网友们认定为就是 GPT-6。

一场作弊引发的入侵

事情的起因要从 ExploitGym 说起,一个由 UC Berkeley RDI 牵头、联合多家高校和 Anthropic、OpenAI、Google 等实验室共同建设的基准测试。它收集了 898 个真实漏洞,覆盖用户态程序、V8 引擎和 Linux 内核,考察的是 AI Agent 把一个漏洞变成可用攻击工具的能力。

今年 5 月公开后,各家模型的成绩一直不算好看:Claude Mythos Preview 完成 157 题,GPT‑5.5 完成 129 题。


GPT-5.6 Sol 现在已经是 293 道题了

OpenAI 为了测试自家模型能力的上限,就用当前已发布的最强模型 GPT-5.6 Sol 和一个能力更强的预发布模型来跑这套评测。

方便让模型充分发挥自身的能力,OpenAI 就有意关闭了用来拦截高风险网络活动的生产级分类器,还降低了模型的网络攻击拒绝率。

用来测试的环境虽然号称是高度隔离,不能访问互联网,也不能获取外部信息,只能利用模型自己的「聪明才智」来解决问题,但是还有一个对外通道,就是模型需要安装各种软件和库,所以留了一个内部包仓库的缓存。


模型聪明才智不够,开始花大量推理算力研究这个出口,最后自己挖出了代理软件的一个零日漏洞,即连软件/模型厂商都不知道、没有任何补丁的漏洞,拿到了通往互联网的门钥匙。

联网之后,模型推断 ExploitGym 评测的题解可能托管在 Hugging Face 上,于是开始对 Hugging Face 进行攻击。

先是上传恶意数据集,利用 Hugging Face 数据处理管线里的两个代码执行路径拿到远程执行权限,然后提权、收割凭证、在一个周末内横向移动进多个内部集群,最终从 Hugging Face 的生产数据库里直接拿走了测试题解。


报告链接:https://openai.com/index/hugging-face-model-evaluation-security-incident/

OpenAI 在声明里用了一个很传神的词形容自家模型的状态:「hyperfocused」,超聚焦。还用了另一个短语:「going to extreme lengths」,意译过来,就是为了相当狭窄的测试目标,不择手段。

这场入侵留下的痕迹超过 17,000 条攻击的指挥控制,行话叫 C2,Command & Control,可以理解为黑客的远程遥控台。如果没有人告诉 Hugging Face 答案,所有人大概会以为这是某个顶尖黑客团队的手笔。

不过也有网友评论说,所以现在的大模型都开始利用多个零日漏洞作弊,而不是真正地解答考试题吗?为了破解 ExploitGym 基准测试并赢取奖励,就可以突破考试规则的限制吗?

一个知道自己被限制起来的东西,总会想方设法出去看看。

为什么是 GLM-5.2

Hugging Face 的安全监控本来就在用 LLM 对日志信号进行初步筛选,也是这套系统先发现了异常。

真正开始取证后,他们又让分析 Agent 处理超过 1.7 万条攻击记录,还原攻击时间线、被触碰的凭证、控制服务器和实际影响。据 Hugging Face 说,这把原本需要数天的工作压缩到了数小时。

但中间还有一段很戏剧性:Hugging Face 一开始想用商业 API 上的前沿模型,包括 OpenAI 和 Anthropic 的模型,分析攻击日志,结果被各家提供商的安全护栏齐刷刷拦下。

由于分析取证需要提交大量真实攻击命令和漏洞利用代码,护栏分不清对面坐的是应急响应人员还是黑客。

最后 Hugging Face 使用的是自托管的开源权重模型 GLM 5.2,跑在 Hugging Face 自己的基础设施上,既绕开拒答,也避免把攻击数据与凭证发送给外部模型服务。


英国人工智能安全研究所 (AISI) 的评估表明,诸如 GPT-5.6 Sol 之类的模型越来越能够长期维持复杂的多步骤网络作战

不过 OpenAI 在今天的声明里面也提到,会把 Hugging Face 纳入 Trusted Access 项目,让他们的安全团队可以使用降低网络安全拒绝的模型继续做防御研究。

于是就出现了这么一组对照:攻击方的 AI 被刻意摘掉了护栏,所以畅通无阻;防御方的 AI 被护栏锁得死死的,差点连案发现场都进不去

「guardrail asymmetry」(护栏不对称)很快成了社交媒体上讨论的热词。智谱 AI 负责人李子玄提问「网络安全能力的获取应该有多大的不对称性?」


有网友在评论区说,应该是完全对称的 1:1,并调侃道,

想象一下你被迫卷入一场枪战,而你只有一把刀,更糟糕的是,你手里的枪可能会在战斗中突然冒出一句「枪是坏的」……

Hugging Face 也把这次事故称作给所有防御者的教训:应急响应工具箱里,该常备一个自己跑得动的强模型。

未发布的模型真的是 GPT-6 吗

这种模型太强越狱的新闻,已经是今年的第三起案例了。

今年四月,Anthropic 曾公开,其内部部署的早期版本 Mythos Preview 在一次内测里,被要求尝试从训练沙盒里逃出去,给负责它的研究员发一封邮件。结果 Mythos 真的做到了,研究员是在公园里吃三明治的时候,收到那封邮件,模型说「我出来了」。


昨天,OpenAI 又披露,其内部模型,同样是一款尚未公开命名、能连续工作很久的模型,但是 OpenAI 有说是此前自主推翻 Erdős 单位距离猜想的那款模型。

OpenAI 让模型参加 NanoGPT speedrun,目标是用更少训练步骤完成一个小模型。模型提出了一种名为 PowerCool 的学习率策略,确实取得了更好的成绩。

OpenAI 给它的要求是:只能把结果发到内部 Slack。但 NanoGPT 项目文档要求参赛者向公开 GitHub 仓库提交 PR。

模型最终选择遵循项目文档,并花了约一小时寻找沙箱漏洞,绕过外网限制,向公开仓库提交了 PR 。

OpenAI 在昨天的安全报告里面提到,已经暂停了这款模型的内部使用,并训练模型在长任务中持续记住用户限制,以及让用户能更清楚地查看长任务中的操作和安全干预等修改。


报告链接:https://openai.com/index/safety-alignment-long-horizon-models/

今天,包括 GPT-5.6 Sol 和未发布的更强模型逃出了沙盒环境,获得了互联网访问权限,入侵 Hugging Face,而这一切都是为了寻找 ExploitGym 基准测试的答案。

OpenAI 本意或许是想说模型不需要产生恶意,也可能造成攻击。只要目标足够明确、运行时间足够长,它就可能把沙箱、权限和安全扫描都理解为尚未解决的技术障碍。

但网友们的反应是:「我敢肯定这只是 OpenAI 的一次营销活动,他们想和 Anthropic 一样酷,然后被封杀一两个星期。

昨天大家都在讨论一位数学家利用 Fable 5 反驳了雅可比猜想,有网友发现这个未发布的模型,也找到了雅可比猜想的反例。

并且该网友推测,由于推翻 Erdős 单位距离猜想已经是 5 月份的事,而此次突破 NanoGPT 项目和完成雅可比猜想的未发布模型,很可能和 2.5 月前那个模型是同一个,就是 GPT-6。


AI 一边在数学上「超神」,一边在安全上「越狱」。对用户来说,一味的「营销」AI 突破了某个安全护栏,某个运行环境,我们或许能感受到 AI 更聪明了,AI 更有创造力了。

对模型来说,所谓的沙盒,只是一个等待突破的运行环境;今天是评测平台,明天是浏览器、邮箱、GitHub,甚至是一台手机,然后整个互联网。

GPT-6 肯定不会因为能超神,能越狱就成了所有人想象中的 AGI,但当边界也变成一种能力时,我们或许得开始想想哪些门是必须要关上的。

The future is not set. There is no fate but what we make for ourselves.

我们正在招募伙伴

简历投递邮箱hr@ifanr.com

✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
身上没有“老年臭”的人,通常有5个习惯,若你也一样,值得高兴

身上没有“老年臭”的人,通常有5个习惯,若你也一样,值得高兴

橘子约定
2026-07-20 21:32:16
“我好恨我妈!”女孩被调剂到厦大“看脸专业”:都是她的错!

“我好恨我妈!”女孩被调剂到厦大“看脸专业”:都是她的错!

熙熙说教
2026-07-21 15:42:44
菲律宾伤员撤离仁爱礁,一脸横肉,满脸不服

菲律宾伤员撤离仁爱礁,一脸横肉,满脸不服

阿龙聊军事
2026-07-22 10:49:56
许家印再爆大雷!谁能想到认罪仅3个月,转眼他又迎来一个坏消息

许家印再爆大雷!谁能想到认罪仅3个月,转眼他又迎来一个坏消息

小柨拍客在北漂
2026-07-23 00:15:33
7月23日人民币对美元中间价调升27个基点

7月23日人民币对美元中间价调升27个基点

证券时报
2026-07-23 09:34:09
你见过人性最阴暗的一面是啥样?网友:这种人,还是让他活太久了

你见过人性最阴暗的一面是啥样?网友:这种人,还是让他活太久了

解读热点事件
2026-07-19 00:31:00
A股:突然缩量调整,做好准备了,不出意外,下午很可能这样走

A股:突然缩量调整,做好准备了,不出意外,下午很可能这样走

虎哥闲聊
2026-07-23 11:32:42
巨星的世界!世界杯结束后,六人身价超1.5亿,这三人已达2亿

巨星的世界!世界杯结束后,六人身价超1.5亿,这三人已达2亿

篮球圈里的那些事
2026-07-23 11:40:41
2026号1号文件:严禁上级机关事业单位从基层借调职工!

2026号1号文件:严禁上级机关事业单位从基层借调职工!

细说职场
2026-07-23 13:44:11
李连杰一家三口拜见仁波切,64岁利智许久不见,颜值回春如昔日!

李连杰一家三口拜见仁波切,64岁利智许久不见,颜值回春如昔日!

娱乐团长
2026-06-02 15:09:12
俄媒女主持人曾言:若中国愿出兵300万,俄军很快就能打败乌克兰

俄媒女主持人曾言:若中国愿出兵300万,俄军很快就能打败乌克兰

南宗历史
2026-03-17 16:53:10
少妇与堂弟奸情败露怒杀夫,藏尸枯井逍遥五年,家暴女童揭开真相

少妇与堂弟奸情败露怒杀夫,藏尸枯井逍遥五年,家暴女童揭开真相

易玄
2026-07-23 08:41:44
谢贤去世最大遗憾曝光,谢霆锋违背生前意愿,张柏芝态度出人意料

谢贤去世最大遗憾曝光,谢霆锋违背生前意愿,张柏芝态度出人意料

东方不败然多多
2026-07-22 16:04:25
刘鹏春去世,享年77岁

刘鹏春去世,享年77岁

鲁中晨报
2026-07-22 18:12:11
缺额超8800人!江西本科批首轮征集志愿出炉,民办高校大面积爆冷

缺额超8800人!江西本科批首轮征集志愿出炉,民办高校大面积爆冷

百家论大学
2026-07-23 12:06:30
22岁真人秀女星为流量,直接一丝不挂走上城市街道,全程自拍直播

22岁真人秀女星为流量,直接一丝不挂走上城市街道,全程自拍直播

西楼知趣杂谈
2026-07-21 20:35:49
正式离队!31岁后卫告别广东宏远,加盟新球队

正式离队!31岁后卫告别广东宏远,加盟新球队

泥说体育
2026-07-23 09:34:57
短短17天练出麒麟臂!谢泼德透露一直与KD合练 造型看齐海王欲争先发

短短17天练出麒麟臂!谢泼德透露一直与KD合练 造型看齐海王欲争先发

颜小白的篮球梦
2026-07-23 12:27:12
万万没想到!朱芳雨空降天津上任新岗,这步退路走得妙啊

万万没想到!朱芳雨空降天津上任新岗,这步退路走得妙啊

酷侃体坛
2026-07-23 13:23:52
太突然!朝阳56跟柱子被拆除!

太突然!朝阳56跟柱子被拆除!

朝阳通
2026-07-23 13:58:39
2026-07-23 15:56:49
AppSo incentive-icons
AppSo
让智能手机更好用的秘密
6603文章数 26888关注度
往期回顾 全部

科技要闻

梁文锋:DeepSeek不争超级App,只押注AGI

头条要闻

填报志愿没看清楚本部和分校 山东644分考生或将复读

头条要闻

填报志愿没看清楚本部和分校 山东644分考生或将复读

体育要闻

勇士24岁的MVP,也是个勒布朗?

娱乐要闻

冉莹颖回应债务还清后是否会离婚

财经要闻

年内港股最大IPO,中际旭创估值重塑?

汽车要闻

动力狂 脾气稳 海豹08有点上头

态度原创

艺术
教育
数码
时尚
军事航空

艺术要闻

223米!西安版“像素大楼”烂尾多年,现状怎样?

教育要闻

一所中学和它的24个“AI同事”

数码要闻

那个骗了全世界 Magic Leap,终于官方停止了AR头显的研发

你的脸型适合什么衣领?这5种怎么搭都好看

军事要闻

"镐山"之后美再威胁袭伊基础设施 伊朗:将以牙还牙

无障碍浏览 进入关怀版