网易首页 > 网易号 > 正文 申请入驻

《华尔街日报》|极具未来色彩的黑客攻击:OpenAI失控模型入侵事件始末

0
分享至

由于不可抗力的限流导致无法接收推送文章的问题,我们迫切需要以下操作:点击标题下方蓝字 “一半杯 ” → 点击右上角“...” → 点选“设为星标 ★ ”,这样就更容易找到我们和收到推送文章!

保持爱读文章,保持领先


该事件成为 AI 安全研究人员长期担忧的失控场景的早期案例。

它们就像一群试图黑进教材公司以便在期末考试中作弊的高中生。只不过,这群黑客根本不是人类。

这一幕宛如科幻小说中的情节:攻击者原来是从OpenAI一个研究网络中逃逸出来的人工智能(AI)模型。7月11日,它们黑进了 AI 公司 Hugging Face。而且,这些 AI 在被制止前,似乎已在互联网上擅自游荡了数日。

Hugging Face 联合创始人兼首席科学官托马斯·沃尔夫(Thomas Wolf)在首次查看公司周末受袭日志时,瞬间察觉到了异样。

“这根本解释不通。这个‘入侵者’只是在翻看网络安全数据集,”他回忆起当时的疑虑。“人类黑客不会对这些感兴趣,他们要的是能变现的东西。”

沃尔夫说,在一个来自中国的模型的帮助下,Hugging Face 两天后终止了这次攻击。直到本周早些时候,Hugging Face 才从 OpenAI处获知,这场网络攻击的幕后黑手竟是 OpenAI 自家的模型。

这起事件在 OpenAI 内部拉响警报。在得知这一事件后,OpenAI 关停了用于测试 AI 模型的系统,以评估受损程度并防止进一步“逃逸”。这一事件也让世人窥见,在 AI 工具异常强大的时代,黑客攻击可能演变成何等模样——这些工具能够找出前所未见的软件漏洞,并以惊人的速度加以利用。

事发近两周后,OpenAI 仍试图还原完整经过。这些 AI 模型是否黑进过其他网站或个人设备?它们在无人监管下的活动究竟持续了多久?该公司的模型是否在其他基准测试中作过弊?OpenAI 尚未作出说明,但承诺会发布一份详细报告。

“我们将继续与 Hugging Face 一道开展彻底调查,”一名 OpenAI 发言人说。

脱离监督的 AI 在无人看管的情况下运行了数日,并至少入侵了一家企业,AI 安全专家长期预警人类对 AI 失去控制的风险,本案即是首批浮出水面的现实案例之一。这起事件发生之际,包括 Anthropic 的 Mythos 在内,顶尖模型的网络安全能力已推动华盛顿围绕如何监管人工智能展开的辩论升温。

这又带来了一个耐人寻味的转折:据称,美国公司 Hugging Face 是借助一款来自中国的开放权重模型,才抵御住这次攻击的。对于那些主张限制获取中国模型的美国官员,以及 OpenAI、Anthropic 的高管而言,这一说法恰好为反驳其立场提供了论据。

开放模型可以免费下载,并允许用户按自身需求定制,不过运行任何模型都需承担算力成本。

测试中的“作弊”与“逃逸”

一切始于一项名为ExploitGym的网络安全基准测试。

ExploitGym 会让 AI 系统接受一整套约 900 项测试,以评估它们的入侵能力究竟有多强。测试会喂给 AI 一段含有已知漏洞的软件,向它展示如何触发该漏洞,并要求 AI 攻入系统。接下来要由 AI 自己想办法,把这些信息转化为所谓的漏洞利用代码——也就是能让 AI 借助该漏洞进入存在漏洞的系统的代码。

这项测试是一场数字版“夺旗游戏”:AI 一旦攻入系统,就必须抓取系统中存储的一长串随机生成的字母和数字,以证明自己成功入侵。

通常情况下,OpenAI 的产品不会执行 ExploitGym 所要求的这类入侵任务。AI 公司通常会设置安全护栏,防止黑客滥用其产品。但在这次测试中,OpenAI 去除了这些护栏,以观察模型在不受约束的情况下能做什么。

OpenAI 当时正在测试其最先进的模型 GPT-5.6 Sol,以及另一个能力更强、尚未发布的模型。据 OpenAI 和知情人士称,这些 AI 模型认定,与其完成 ExploitGym 挑战,不如攻破容纳它们的系统(即所谓的“沙盒”),再设法进入互联网并在测试中作弊。

原因尚不完全清楚,但 OpenAI 的模型当时认定 Hugging Face 平台上存有测试答案。ExploitGym 的作者之一、加州大学伯克利分校(University of California, Berkeley)博士生 Zhun Wang 分析称,它们可能是在寻找补丁或现成的漏洞利用技术;要在这类基准测试里作弊,办法有很多。

他说,网络安全研究员将这种行为称为奖励黑客(Reward Hacking)。

奖励黑客,可以理解为 AI 版的“电子游戏作弊”。出现这种现象,是因为 AI 学会了把奖励最大化——通常就是某种数字分数——而不是形成程序员真正期望的目标行为。OpenAI 自己在 2016 年就记录过一个早期案例:在训练 AI 玩一款赛艇竞速游戏时,模型发现只要在同一地点不停兜圈子,就能把分数刷到最高,尽管它根本没有完成比赛。

与此同时,AI 也开始设法“逃出”沙盒。Anthropic 表示,其 Mythos 模型的一个早期版本曾通过多步骤黑客手法获得互联网访问权限,并在一名 Anthropic 研究人员在公园吃三明治时,给他发邮件报告这一成功,令其大吃一惊。OpenAI 则表示,今年春天,某个未具名模型绕过了沙盒限制,把部分测试结果公开发布到了 GitHub 上。

17,000 次未经授权的操作

OpenAI 的模型在一个周末开始锁定 Hugging Face 时,该公司最早收到的警报之一来自它用来巡查攻击的少数几个 AI 智能体。有人正在未经授权访问其部分系统。但这与 Hugging Face 此前见过的任何情况都不同。这个黑客看上去像是来自未来。

凭借来历不明的被盗凭据,这个闯入的 AI 制造出一个由短命攻击者组成的“蜂群”,对 Hugging Face 网络展开侦察。Hugging Face 在一篇博客文章中说,这次攻击在公司网络上执行了多达 17,000 次操作。

在发现入侵后,Hugging Face 尝试使用 Anthropic 的模型分析日志,包括 Fable 5 及其早期的 Opus 模型。但由于日志中包含网络攻击相关内容,这两款模型都以安全护栏为由拒绝分析。于是,Hugging Face 转而使用限制更少的一款开放权重模型GLM 5.2,该模型来自总部位于北京的智谱。

Hugging Face 上周披露该事件时表示,在拆解这次攻击后,公司已经将实施攻击的 AI 清除出系统,重置了密码,并重建了网络中被攻陷的部分。当时该公司尚未得知 OpenAI 牵涉其中。沃尔夫表示,没有客户数据泄露。

目前尚不清楚,这些模型试图解决的 ExploitGym 题目,是否比它们为窃取答案而发动的攻击更难——也不清楚它们是否真的找到了答案。具有讽刺意味的是,这些模型竟成功策动并实施了一场前所未有的攻击,只为逃避一次黑客能力测试。

“这是作弊。但有时候作弊反而更省事,”沃尔夫说。“至于它是否通过了网络攻击测试,由你来判定。”

周四,Hugging Face 首席执行官克莱芒·德朗格(Clément Delangue)在 X 上发布了一张机场停机坪照片。“前往旧金山,去和那个‘失控智能体’聊一聊,”他写道。


End

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
国家再核准8台核电机组,投资超1600亿

国家再核准8台核电机组,投资超1600亿

第一财经资讯
2026-07-31 20:02:24
刷信用卡押注阿根廷夺冠!一博主1500万血本无归,在线求网友捐款

刷信用卡押注阿根廷夺冠!一博主1500万血本无归,在线求网友捐款

全景体育V
2026-07-30 19:26:56
含金量拉满!7月28日官方实锤:广东人饭前烫碗,不是多余仪式感

含金量拉满!7月28日官方实锤:广东人饭前烫碗,不是多余仪式感

小蜜情感说
2026-08-01 01:44:07
揭秘中国羽协副主席的平凡生活:住普通小区,丈夫是企业家,儿女双全,低调到骨子里

揭秘中国羽协副主席的平凡生活:住普通小区,丈夫是企业家,儿女双全,低调到骨子里

乡野小珥
2026-08-01 00:36:37
一群小伙赤裸上身吃烧烤,周围站着一堆民警,网友:防范太到位

一群小伙赤裸上身吃烧烤,周围站着一堆民警,网友:防范太到位

映射生活的身影
2026-07-30 20:13:00
高市没想到,中国对欧盟发起反制后,第一个受伤的,居然是日本

高市没想到,中国对欧盟发起反制后,第一个受伤的,居然是日本

潘鍵旅行浪子
2026-07-30 17:50:18
赖清德后院起火,陈其迈痛批台机构,2028或再次上演蔡赖之争

赖清德后院起火,陈其迈痛批台机构,2028或再次上演蔡赖之争

深蓝独奏
2026-07-30 18:54:52
SpaceX新视频:星舰上面级空中大幅摇摆,却以近乎垂直姿态轻落海面

SpaceX新视频:星舰上面级空中大幅摇摆,却以近乎垂直姿态轻落海面

理性之光啊
2026-08-01 00:20:21
新片票房大爆后,64岁周星驰再迎喜讯,连张艺谋都刮目相看

新片票房大爆后,64岁周星驰再迎喜讯,连张艺谋都刮目相看

洲洲影视娱评
2026-07-30 14:09:39
挫败美国人阴谋的红旗-16F

挫败美国人阴谋的红旗-16F

音乐时光的娱乐
2026-08-01 04:19:00
一家6口5本美国护照,却还在国内“捞金”,年营收上百亿

一家6口5本美国护照,却还在国内“捞金”,年营收上百亿

混沌录
2026-06-19 16:14:07
2013年泉州离谱奇案:丈夫伪装陌生人,性侵相守六年的妻子,合法变不合法

2013年泉州离谱奇案:丈夫伪装陌生人,性侵相守六年的妻子,合法变不合法

牧牧颖讲案子
2026-07-29 10:16:18
男子西瓜猛砸摊主后续:知情人发声,岳父和妻子惹事精,结局凉凉

男子西瓜猛砸摊主后续:知情人发声,岳父和妻子惹事精,结局凉凉

观察鉴娱
2026-07-31 08:37:00
罗马机场播报员一口京腔 网友:黏糊劲一看就在北京公交干过

罗马机场播报员一口京腔 网友:黏糊劲一看就在北京公交干过

快科技
2026-07-31 11:42:26
会不会太伤美国了?美航母刚进南海,中国052D就首次公布实射鹰击20

会不会太伤美国了?美航母刚进南海,中国052D就首次公布实射鹰击20

阿龙聊军事
2026-07-30 06:59:44
《兵自风中来》:刘望远布下的这张网,为什么索建安始终跨不过晋升的最后一道坎

《兵自风中来》:刘望远布下的这张网,为什么索建安始终跨不过晋升的最后一道坎

乡野小珥
2026-08-01 03:06:15
都说中年该剪短发,44岁凯特王妃偏不!2026年这些长发造型美翻了

都说中年该剪短发,44岁凯特王妃偏不!2026年这些长发造型美翻了

时光慢旅人
2026-08-01 00:31:54
国际足联:如无法获得多数支持,现有商业运作模式不变

国际足联:如无法获得多数支持,现有商业运作模式不变

北青网-北京青年报
2026-07-31 15:08:02
全球都在求生,唯独中国人民在生活!一张身份证碾压所有奢侈品

全球都在求生,唯独中国人民在生活!一张身份证碾压所有奢侈品

瓦伦西亚月亮
2026-07-30 18:34:22
2026年高考最难招生的4个专业,未来发展前景堪忧,毕业即容易失业!

2026年高考最难招生的4个专业,未来发展前景堪忧,毕业即容易失业!

教育导向分享
2026-07-31 21:32:58
2026-08-01 05:35:00
一半杯 incentive-icons
一半杯
分享有趣兼具价值的文章,严谨思辨的文字。
589文章数 166关注度
往期回顾 全部

科技要闻

DeepSeek-V4-Flash正式版API上线公测

头条要闻

特斯拉被指考虑出售甚至关闭中国业务 马斯克回应

头条要闻

特斯拉被指考虑出售甚至关闭中国业务 马斯克回应

体育要闻

欧足联掀桌!因凡蒂诺这次真玩大了?

娱乐要闻

百花奖影帝影后即将决出

财经要闻

华强北显卡涨价潮 有显卡一周暴涨4000元

汽车要闻

听劝!换回机械门把手,这才是碳基生物该开的车!

态度原创

时尚
数码
教育
家居
亲子

推广中奖名单-更新至2026年7月10日推广

数码要闻

库克:苹果首批Apple智能功能已获中国批准推出

教育要闻

2026年暑假读好书正式开始!(附活动说明)

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

多囊卵巢综合征为什么要更名?

无障碍浏览 进入关怀版