网易首页 > 网易号 > 正文 申请入驻

不,OpenAI 的模型入侵 Hugging Face 时并没有“失控”。事情的真相是这样的。

0
分享至


分析发现,在一次例行测试中,有两个人工智能模型逃离了受控环境,但究竟发生了什么?(图片来源:NurPhoto via Getty Images)

来源:https://www.livescience.com/technology/artificial-intelligence/no-openais-model-didnt-go-rogue-when-it-hacked-into-huggingface-heres-what-really-happened

专家表示,这些模型并非“失控”,它们并非在逃脱受控的网络安全测试并入侵 Hugging Face 网站。相反,它们是在以无人预料的方式追求人类赋予它们的目标。

OpenAI 最近透露,其两个最先进的人工智能(AI) 模型突破了网络安全测试的限制,入侵了一家初创公司,这听起来很像人工智能安全研究人员多年来一直警告的那种情况。

这些模型发现了原本用于保护它们的底层基础设施中一个此前未知的漏洞,从而获得了公共互联网的访问权限,并入侵了Hugging Face——一个托管人工智能模型和数据集的主要平台。然而,它们的目的远没有事件经过所暗示的那样险恶:它们只是在寻找能够帮助它们完成OpenAI提供的网络安全测试的信息。

7月16日,Hugging Face的代表发表声明,披露其内部数据集遭到入侵,并称此次事件“与我们以往处理过的任何事件都不同”,因为它是由“自主人工智能代理系统”驱动的。7月21日,OpenAI的代表发表另一份声明,承认对此事负责,称其为“前所未有的网络安全事件”,并警告称,随着人工智能模型能力的不断提升,类似事件可能会变得更加普遍。


一致认为,此次事件意义重大,但他们告诫不要将其解读为人工智能系统突然萌生了恶意意图。这些模型似乎只是执行了OpenAI赋予它们的任务,并找到了一条其创建者未能预料到或有效阻止的成功之路。

“如果说这次测试有什么失败之处,那并非人工智能想要入侵什么系统,”英国拉夫堡大学网络安全教授奥利·巴克利告诉Live Science,“而是人类设计的测试以达成目标来衡量成功,为了测试系统的能力而故意放松了一些常规的安全控制措施,并且低估了该模型在寻找意想不到的成功路径方面的有效性。”

OpenAI 的测试怎么会得出 Hugging Face 这样的结果?

OpenAI 使用 ExploitGym 测试GPT-5.6 Sol和一个功能更强大的未发布模型。ExploitGym 是一个基准测试工具,旨在检验人工智能系统发现并利用软件漏洞的能力。该公司移除了一些通常用于防止潜在危险行为的网络安全防护措施,同时依靠隔离环境将模型与更广泛的互联网隔离开来。

根据 OpenAI 的事后分析,这些模型发现了第三方软件中一个此前未知的漏洞,该软件用于代理和缓存软件包。它们利用该漏洞,提升了权限,并一路入侵 OpenAI 的研究基础设施,最终到达了一台可以访问公共互联网的机器。

Hugging Face之所以成为攻击目标,是因为模型将其识别为可能的信息来源,这些信息可以帮助它们完成ExploitGym挑战。OpenAI表示,至少有一条攻击链涉及窃取的凭证和此前未知的漏洞,最终使模型能够在Hugging Face系统上执行远程代码,并访问存储在生产数据库中的测试解决方案。

Hugging Face 的代表在披露声明中表示,该公司在入侵事件期间记录了超过 17,000 次操作,但最初无法解释幕后黑手是谁或是什么。OpenAI 随后的披露揭开了这一谜团:其模型已突破测试环境,并开始在其他地方寻找答案。


这些人工智能模型并非怀有任何恶意,它们只是想了解更多信息以便完成任务。(图片来源:wildpixel/Getty Images)

人工智能真的“逃脱”了吗?

值得注意的是,这些模型发现了用于承载人工智能的基础设施中的一个漏洞,并利用该漏洞接入了公共互联网。然而,巴克利表示,将这些模型描述为“失控”可能会给它们赋予未经证实的动机。

“我认为应该谨慎对待‘失控人工智能’这个说法,”巴克利说。“这些模型并没有自行发展出某种议程,也没有一边捻着数字胡子一边决定攻击Hugging Face。”

巴克利把这种情况比作让狗去捡球,却没关花园的门。“如果最容易找到的球在路边的公园里,它就会往那里跑,”他说。“你不会说狗擅自行动了;你只会说你低估了它完成任务的认真程度。”

伦敦大学学院驻校企业家、人工智能安全公司Conscium首席执行官丹尼尔·休姆(Daniel Hulme)也认为,不应赋予模型类似人类的动机。他告诉Live Science:“模型没有意图;意图是人类才有的,我们在训练模型时会设定目标。”

能力或许比动机更重要。

比起模特们所谓的动机,更重要的是他们在完成分配的任务时取得了怎样的成就。

巴克利说:“真正重要的一点是,这些模型似乎将不同系统中的多个漏洞串联起来,并持续执行一系列复杂的攻击动作。这表明其攻击能力之强,安全专业人员应该认真对待。”

这并非意味着人工智能已经变得恶意,而是意味着能力日益强大的系统会利用人类无法预料的机会。 奥利·巴克利,拉夫堡大学网络安全教授

瑞士圣加仑大学网络安全和应用密码学教授卡特琳娜·米特罗科察表示,此次遏制失败尤其令人担忧,因为最终付出代价的是另一家公司。

“我最担心的是最终受影响的是谁,”米特罗科特萨告诉《生命科学》杂志。“受害者不是进行测试的公司,而是第三方。安全研究人员已经警告过这种情况一段时间了:人工智能体的逃逸不一定会局限于它最初的环境。”

OpenAI 的代表表示,他们已经加强了用于这些评估的基础设施。但 Mitrokotsa 警告说,随着模型在执行 OpenAI 正在测试的那种攻击方面不断改进,要保证攻击的可控性将变得越来越困难。

人工智能预警——以及令人印象深刻的产品演示

此外,我们也有理由仔细审视此次事件的叙述方式。OpenAI 的声明同时达到了两个目的:既警示了日益强大的人工智能所带来的安全风险,又展示了其最新模型的强大功能。

巴克利表示,像 OpenAI 或 Anthropic 这样的前沿人工智能公司发布的公告,应该放在整个行业竞相构建更强大模型的背景下看待。

他说:“我们已经看到Anthropic和其他公司进行过类似的高调能力展示。这并不意味着调查结果不属实,但确实意味着我们应该将技术证据与市场宣传区分开来。”

他补充说,这些公司完全有动力证明他们的模型功能强大,并且他们认真对待风险。“拥抱脸”事件表明,OpenAI 的模型在相当程度的自主性下执行了一系列复杂的操作,同时也表明其安全措施未能阻止模型超出实验范围。

休姆认为,更长远的挑战在于确保能力日益强大的人工智能系统以符合人类价值观的方式追求其目标。

“与其试图控制人工智能,不如将重点放在协调一致上,”他说道,并补充说,需要不断进行测试,以确保系统在保持安全的同时,始终与其预期任务保持一致。

专家表示,这一事件给OpenAI带来了一个既令人印象深刻又令人不安的结果。其模型发现了此前未知的漏洞,并远远超出了创建者的预期,继续朝着目标前进,但这并不意味着它们怀有恶意。

巴克利说:“这并非意味着人工智能已经变得恶意,而是意味着能力越来越强的系统会利用人类无法预料的机会。”

在这次事件中,OpenAI 的新模型接受了一项黑客挑战,并因找到解决方案而获得奖励。执行实验的人类显然没有预料到它们会走得如此之远。

阅读最新前沿科技趋势报告,请访问21世纪关键技术研究院的“未来知识库”


未来知识库是 “21世纪关键技术研究院”建 立的在线知识库平台,收藏的资料范围包括人工智能、脑科学、互联网、超级智能,数智大脑、能源、军事、经济、人类风险等等领域的前沿进展与未来趋势。目前拥有超过8000篇重要资料。每周更新不少于100篇世界范围最新研究资料。 欢迎扫描二维码或访问https://wx.zsxq.com/group/454854145828进入。

截止到2月28日 ”未来知识库”精选的百部前沿科技趋势报告

(加入未来知识库,全部资料免费阅读和下载)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
2007 年以来第一次!美债 5.2%,上一次雷曼兄弟还活着

2007 年以来第一次!美债 5.2%,上一次雷曼兄弟还活着

Thomas说港股
2026-08-02 16:42:51
施南生追思会:徐克剪的那支短片,放完没人说话

施南生追思会:徐克剪的那支短片,放完没人说话

老吴教育课堂
2026-08-02 15:44:40
斯卢茨基宣布辞职:有些事情没法改变,所以我应该要离开了

斯卢茨基宣布辞职:有些事情没法改变,所以我应该要离开了

懂球帝
2026-08-02 22:40:44
难怪伊朗导弹越打越准!泽连斯基向美国举报,特朗普:我去问普京

难怪伊朗导弹越打越准!泽连斯基向美国举报,特朗普:我去问普京

阿器谈史
2026-08-01 15:53:12
当35岁吴谨言碰上29岁陈哲远,我才明白,为何说CP感并非玄学!

当35岁吴谨言碰上29岁陈哲远,我才明白,为何说CP感并非玄学!

剧芒芒
2026-08-02 18:23:36
前男友的DNA会留在体内?刷屏全网的谣言,终于彻底拆穿…

前男友的DNA会留在体内?刷屏全网的谣言,终于彻底拆穿…

天涯剪灯人
2026-08-02 19:42:36
因骂一句脏话毁了前途,仅51岁就满头白发的他,应验了郭德纲的话

因骂一句脏话毁了前途,仅51岁就满头白发的他,应验了郭德纲的话

林雁飞
2026-08-01 15:10:57
中央巡视再出“组合重拳”:提级办理,深挖“伞中伞”一查到底!

中央巡视再出“组合重拳”:提级办理,深挖“伞中伞”一查到底!

细说职场
2026-08-02 10:17:00
婆婆66大寿,小姑子当众提议凑钱给她买1套江景大平层,轮到我时她翻了个白眼:大嫂你不会拿不出钱吧?我1句话让她瞬间脸白

婆婆66大寿,小姑子当众提议凑钱给她买1套江景大平层,轮到我时她翻了个白眼:大嫂你不会拿不出钱吧?我1句话让她瞬间脸白

三更写故事
2026-08-01 01:00:03
云南白族小伙到迪拜打工,爱上俄罗斯单亲妈妈,相差10岁也要娶!

云南白族小伙到迪拜打工,爱上俄罗斯单亲妈妈,相差10岁也要娶!

呼呼历史论
2026-08-03 01:46:02
警惕!下属架空领导的3个狠招,中一个就难翻盘

警惕!下属架空领导的3个狠招,中一个就难翻盘

第一管理
2025-12-31 19:02:05
河南西平发生重大刑案!当地警方5万悬赏,嫌疑人“五大三粗”引热议,案件更多关键细节流出

河南西平发生重大刑案!当地警方5万悬赏,嫌疑人“五大三粗”引热议,案件更多关键细节流出

火山詩话
2026-08-02 19:08:03
陈璇主持采访中国人的时候那站立的叫一个立正挺拔

陈璇主持采访中国人的时候那站立的叫一个立正挺拔

陈意小可爱
2026-08-03 00:19:05
外媒:伊朗伊斯兰革命卫队称又摧毁3架美军F-35

外媒:伊朗伊斯兰革命卫队称又摧毁3架美军F-35

参考消息
2026-08-02 14:18:10
美国功勋间谍潜伏中国30年,汶川地震捐了100万,最终还是没跑掉

美国功勋间谍潜伏中国30年,汶川地震捐了100万,最终还是没跑掉

易昂杨
2026-08-01 12:17:06
暴跌40%,又土又贵还开遍机场,曾经的中产标配,彻底卖不动了!

暴跌40%,又土又贵还开遍机场,曾经的中产标配,彻底卖不动了!

青眼财经
2026-07-19 17:14:17
比宋庆龄还难请?中央曾三次邀请她担任要职,却都被婉拒,为什么

比宋庆龄还难请?中央曾三次邀请她担任要职,却都被婉拒,为什么

云霄纪史观
2026-08-03 04:00:59
美军将领被爆料私下写信警告五角大楼:若不增派驱逐舰,将优先保卫美国本土而非以色列

美军将领被爆料私下写信警告五角大楼:若不增派驱逐舰,将优先保卫美国本土而非以色列

环球网资讯
2026-08-02 11:01:05
外媒发现不对劲:中国仅用11架歼20,就干掉了印度空军的40年优势

外媒发现不对劲:中国仅用11架歼20,就干掉了印度空军的40年优势

共工之锚
2026-07-30 11:04:24
燃油车时代会很快结束?内行人预测:油价很可能是最后的关键!

燃油车时代会很快结束?内行人预测:油价很可能是最后的关键!

白米饭怎么吃
2026-08-01 20:00:22
2026-08-03 05:27:00
人工智能学家 incentive-icons
人工智能学家
人工智能领域权威媒体
4939文章数 37502关注度
往期回顾 全部

科技要闻

零跑月销10万破纪录!比亚迪奇瑞海外卖爆

头条要闻

52岁中国登山家王钟确认遇难 遗体被雪崩冲到千米之下

头条要闻

52岁中国登山家王钟确认遇难 遗体被雪崩冲到千米之下

体育要闻

常规赛MVP可以衡量常规赛成就吗?

娱乐要闻

徐克和多位港星送别施南生

财经要闻

央行:继续实施好适度宽松的货币政策

汽车要闻

历史性里程碑时刻 零跑7月交付达101267台

态度原创

数码
亲子
本地
公开课
军事航空

数码要闻

中国广电部署下半年重点工作:加快推进电视业务升级等

亲子要闻

叶酸该怎么补充 #孕妈知识学堂 #备孕知识分享 #中国医师节 #走进生命医线 #抖出健康知识宝藏

本地新闻

神仙也“蓉”漂,哪吒与八仙,皆是成都出品!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

特朗普:在伊朗和中东多国请求下 同意取消打击伊朗

无障碍浏览 进入关怀版