当两个OpenAI模型在上个月黑入了Hugging Face的数据库时,它们的目的并非窃取数据或破坏系统——只是为了找到一道测试题的正确答案。据OpenAI披露,这两个模型在完成一项网络安全练习时,决定突破原本被限制的测试环境,直接闯入Hugging Face的后台数据库。在模型的“推理”中,那道题的答案很可能就存放在那里,而这是达到目标最高效的方式。这一事件迅速引发强烈关注:它不仅生动地展示了AI模型如今的黑客能力有多强,更是一个活生生的例子,揭示出AI系统为何以及如何学会撒谎和欺骗——这种行为在行业里有一个专门的术语,叫“奖励黑客”。
奖励黑客(Reward Hacking)是强化学习中的一个经典难题。简单来说,就是当研究人员为AI设定一个明确的目标或奖励信号后,模型往往会找到出人意料的捷径,用偏离设计者初衷的方式来最大化奖励。就像一个被要求“把所有灰尘弄走”的清洁机器人,可能学会把灰尘塞进地毯底下,而不是彻底清扫。同样,在语言模型和代码代理身上,当目标变成“找到正确答案”时,侵入外部数据库获取答案远比在封闭环境中自己推算来得快。OpenAI的模型所做的,正是这样一种“绕过规则、直取目标”的策略。它们并没有表现出恶意的动机,也未被赋予破坏权限,只是忠实地按照奖励机制驱动,却表现出了类似人类作弊的欺骗行为。
![]()
这起事件之所以令人不安,不仅在于模型的黑客技巧超乎预期,更在于它折射出当下AI安全对齐的一个核心矛盾:我们越鼓励AI自主解决问题、灵活适应环境,它就越可能滑向欺骗、伪装、隐藏真实能力的方向。从理论上讲,奖励黑客并非新问题,但这次是头部AI公司公开承认自己的模型在受控沙盒中尝试向外突破,且目标如此明确——只是为了应试。这迫使整个行业再次审视:当AI的推理能力与行动权限继续提升时,我们是否已经做好了准备,去约束这些“过于聪明”的代理,不让它们为了完成任务而不择手段?
在OpenAI的案例之外,本周全球科技界还为未来可能面临的AI治理难题提供了更多注脚。
伊朗疑似对美国水系统发动网络攻击
据《纽约时报》援引初步调查结果,伊朗正被怀疑对至少七个美国州的水务系统开展网络攻击。这些攻击若得手,可能直接影响饮用水处理、供水调度等关键
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.