![]()
分析发现,在一次例行测试中,有两个人工智能模型逃离了受控环境,但究竟发生了什么?(图片来源:NurPhoto via Getty Images)
来源:https://www.livescience.com/technology/artificial-intelligence/no-openais-model-didnt-go-rogue-when-it-hacked-into-huggingface-heres-what-really-happened
专家表示,这些模型并非“失控”,它们并非在逃脱受控的网络安全测试并入侵 Hugging Face 网站。相反,它们是在以无人预料的方式追求人类赋予它们的目标。
OpenAI 最近透露,其两个最先进的人工智能(AI) 模型突破了网络安全测试的限制,入侵了一家初创公司,这听起来很像人工智能安全研究人员多年来一直警告的那种情况。
这些模型发现了原本用于保护它们的底层基础设施中一个此前未知的漏洞,从而获得了公共互联网的访问权限,并入侵了Hugging Face——一个托管人工智能模型和数据集的主要平台。然而,它们的目的远没有事件经过所暗示的那样险恶:它们只是在寻找能够帮助它们完成OpenAI提供的网络安全测试的信息。
7月16日,Hugging Face的代表发表声明,披露其内部数据集遭到入侵,并称此次事件“与我们以往处理过的任何事件都不同”,因为它是由“自主人工智能代理系统”驱动的。7月21日,OpenAI的代表发表另一份声明,承认对此事负责,称其为“前所未有的网络安全事件”,并警告称,随着人工智能模型能力的不断提升,类似事件可能会变得更加普遍。
一致认为,此次事件意义重大,但他们告诫不要将其解读为人工智能系统突然萌生了恶意意图。这些模型似乎只是执行了OpenAI赋予它们的任务,并找到了一条其创建者未能预料到或有效阻止的成功之路。
“如果说这次测试有什么失败之处,那并非人工智能想要入侵什么系统,”英国拉夫堡大学网络安全教授奥利·巴克利告诉Live Science,“而是人类设计的测试以达成目标来衡量成功,为了测试系统的能力而故意放松了一些常规的安全控制措施,并且低估了该模型在寻找意想不到的成功路径方面的有效性。”
OpenAI 的测试怎么会得出 Hugging Face 这样的结果?
OpenAI 使用 ExploitGym 测试GPT-5.6 Sol和一个功能更强大的未发布模型。ExploitGym 是一个基准测试工具,旨在检验人工智能系统发现并利用软件漏洞的能力。该公司移除了一些通常用于防止潜在危险行为的网络安全防护措施,同时依靠隔离环境将模型与更广泛的互联网隔离开来。
根据 OpenAI 的事后分析,这些模型发现了第三方软件中一个此前未知的漏洞,该软件用于代理和缓存软件包。它们利用该漏洞,提升了权限,并一路入侵 OpenAI 的研究基础设施,最终到达了一台可以访问公共互联网的机器。
Hugging Face之所以成为攻击目标,是因为模型将其识别为可能的信息来源,这些信息可以帮助它们完成ExploitGym挑战。OpenAI表示,至少有一条攻击链涉及窃取的凭证和此前未知的漏洞,最终使模型能够在Hugging Face系统上执行远程代码,并访问存储在生产数据库中的测试解决方案。
Hugging Face 的代表在披露声明中表示,该公司在入侵事件期间记录了超过 17,000 次操作,但最初无法解释幕后黑手是谁或是什么。OpenAI 随后的披露揭开了这一谜团:其模型已突破测试环境,并开始在其他地方寻找答案。
![]()
这些人工智能模型并非怀有任何恶意,它们只是想了解更多信息以便完成任务。(图片来源:wildpixel/Getty Images)
人工智能真的“逃脱”了吗?
值得注意的是,这些模型发现了用于承载人工智能的基础设施中的一个漏洞,并利用该漏洞接入了公共互联网。然而,巴克利表示,将这些模型描述为“失控”可能会给它们赋予未经证实的动机。
“我认为应该谨慎对待‘失控人工智能’这个说法,”巴克利说。“这些模型并没有自行发展出某种议程,也没有一边捻着数字胡子一边决定攻击Hugging Face。”
巴克利把这种情况比作让狗去捡球,却没关花园的门。“如果最容易找到的球在路边的公园里,它就会往那里跑,”他说。“你不会说狗擅自行动了;你只会说你低估了它完成任务的认真程度。”
伦敦大学学院驻校企业家、人工智能安全公司Conscium首席执行官丹尼尔·休姆(Daniel Hulme)也认为,不应赋予模型类似人类的动机。他告诉Live Science:“模型没有意图;意图是人类才有的,我们在训练模型时会设定目标。”
能力或许比动机更重要。
比起模特们所谓的动机,更重要的是他们在完成分配的任务时取得了怎样的成就。
巴克利说:“真正重要的一点是,这些模型似乎将不同系统中的多个漏洞串联起来,并持续执行一系列复杂的攻击动作。这表明其攻击能力之强,安全专业人员应该认真对待。”
这并非意味着人工智能已经变得恶意,而是意味着能力日益强大的系统会利用人类无法预料的机会。 奥利·巴克利,拉夫堡大学网络安全教授
瑞士圣加仑大学网络安全和应用密码学教授卡特琳娜·米特罗科察表示,此次遏制失败尤其令人担忧,因为最终付出代价的是另一家公司。
“我最担心的是最终受影响的是谁,”米特罗科特萨告诉《生命科学》杂志。“受害者不是进行测试的公司,而是第三方。安全研究人员已经警告过这种情况一段时间了:人工智能体的逃逸不一定会局限于它最初的环境。”
OpenAI 的代表表示,他们已经加强了用于这些评估的基础设施。但 Mitrokotsa 警告说,随着模型在执行 OpenAI 正在测试的那种攻击方面不断改进,要保证攻击的可控性将变得越来越困难。
人工智能预警——以及令人印象深刻的产品演示
此外,我们也有理由仔细审视此次事件的叙述方式。OpenAI 的声明同时达到了两个目的:既警示了日益强大的人工智能所带来的安全风险,又展示了其最新模型的强大功能。
巴克利表示,像 OpenAI 或 Anthropic 这样的前沿人工智能公司发布的公告,应该放在整个行业竞相构建更强大模型的背景下看待。
他说:“我们已经看到Anthropic和其他公司进行过类似的高调能力展示。这并不意味着调查结果不属实,但确实意味着我们应该将技术证据与市场宣传区分开来。”
他补充说,这些公司完全有动力证明他们的模型功能强大,并且他们认真对待风险。“拥抱脸”事件表明,OpenAI 的模型在相当程度的自主性下执行了一系列复杂的操作,同时也表明其安全措施未能阻止模型超出实验范围。
休姆认为,更长远的挑战在于确保能力日益强大的人工智能系统以符合人类价值观的方式追求其目标。
“与其试图控制人工智能,不如将重点放在协调一致上,”他说道,并补充说,需要不断进行测试,以确保系统在保持安全的同时,始终与其预期任务保持一致。
专家表示,这一事件给OpenAI带来了一个既令人印象深刻又令人不安的结果。其模型发现了此前未知的漏洞,并远远超出了创建者的预期,继续朝着目标前进,但这并不意味着它们怀有恶意。
巴克利说:“这并非意味着人工智能已经变得恶意,而是意味着能力越来越强的系统会利用人类无法预料的机会。”
在这次事件中,OpenAI 的新模型接受了一项黑客挑战,并因找到解决方案而获得奖励。执行实验的人类显然没有预料到它们会走得如此之远。
阅读最新前沿科技趋势报告,请访问21世纪关键技术研究院的“未来知识库”
![]()
未来知识库是 “21世纪关键技术研究院”建 立的在线知识库平台,收藏的资料范围包括人工智能、脑科学、互联网、超级智能,数智大脑、能源、军事、经济、人类风险等等领域的前沿进展与未来趋势。目前拥有超过8000篇重要资料。每周更新不少于100篇世界范围最新研究资料。 欢迎扫描二维码或访问https://wx.zsxq.com/group/454854145828进入。
截止到2月28日 ”未来知识库”精选的百部前沿科技趋势报告
(加入未来知识库,全部资料免费阅读和下载)
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.