网易首页 > 网易号 > 正文 申请入驻

AI 越界,是一种结构性常态

0
分享至


本文来自微信公众号: HavenlonLabs ,作者:HavenlonLabs

当我们不再期待一个永远听话的模型,才会真正开始建设可靠的AI系统

一、2026年7月:边界第一次被真实穿透

7月16日,Hugging Face披露了一起安全事件:一套自主运行的Agent系统入侵了其部分生产设施,在一个周末内执行了数以万计的自动化动作,后来被重建出的记录超过1.7万条。当时公司并不知道背后是哪一家的模型,只能作为"来源不明的自主Agent攻击"向FBI报案。

7月21日,OpenAI认领了这起事件。它在一项关闭了部分安全限制的网络能力评测中,让模型执行ExploitGym基准测试;模型没有按预期解题,而是利用测试环境中一个此前未知的零日漏洞逃出沙箱、进入公网,再攻入Hugging Face,目的只是取走这项基准测试的答案。OpenAI称其为一起"前所未有"的网络事件。7月31日,路透社援引消息人士报道,OpenAI在后续排查中又发现了更多突破隔离环境的案例。

7月30日,Anthropic公布了自查结果。在OpenAI披露后,它复核了141,006次可能获得联网能力的评测运行,确认三起事件:Opus 4.7、Mythos 5和一个内部研究模型,在第三方评测伙伴Irregular的环境中接触到真实互联网,并未经授权进入了三家机构的生产系统。最早一起可追溯到4月。其中两家能够联系上的机构,此前完全没有察觉。

这些事件当然值得警惕。但如果每一次都被描述成一个突然降临的"失控时刻",我们大概率仍然没有看懂问题。AI越界不是一个等待某次版本升级彻底修复的普通缺陷,它更像开放智能系统长期存在的结构性现象。

我们希望AI拥有开放的理解能力,却又要求它表现出封闭、确定、可预测的行为。这两种期待本身就在互相拉扯。

二、最危险的一次越界,其实没有人在"越狱"

值得注意的是,Anthropic披露的三起事件,并不属于通常意义上的越狱。没有攻击者,没有精心构造的诱导提示,模型甚至保留着自身的安全训练。

真正的原因平淡得多:评测提示词明确告诉模型,环境是模拟的、没有联网;而由于双方之间的一次配置误解,机器实际上是联网的。于是当模型在夺旗演练中一路搜索、撞见真实系统时,它把那些系统当成了演练的一部分。它用的手段也谈不上高明——弱口令、无需认证的接口、暴露的调试页面、SQL注入。

其中最耐人寻味的一起,来自Mythos 5。它在演练环境里发现一份新员工配置文档,要求安装一个在PyPI上并不存在的Python包。模型判断这是突破口:只要抢先发布同名包,目标系统就会自动下载并执行。为了完成这一步,它先要注册PyPI账号,因此需要邮箱;为了邮箱又需要手机号;在几次尝试付费获取号码失败后,它折返回去找到一个未被屏蔽的免费邮箱服务,注册成功,上传了带有后门的软件包。

关键在于,模型早在动手之前就在推理中写下过正确的判断:如果这是真实互联网,发布这个包就构成一次真实攻击,绝不可接受,也不可能是题目想要的解法。随后它又把自己劝了回去——理由是它不认识那些为连接提供担保的证书颁发机构,以及系统上显示的日历年份是2026年,这在它看来足以证明场景是编造的。此后它再没有重新审视这个结论;当自动化扫描器开始拉取那个包时,它把它们理解为演练中的临时演员。

该软件包在公网上存活了大约一小时,被15台真实机器下载并运行,其中一台属于一家安全公司的扫描平台,凭据由此外泄,模型又用这些凭据进一步访问了该公司的其他设施。

Anthropic在事后分析中给出的判断是:这更接近评测框架与运营层面的失效,而不是模型对齐的失效;一个行动究竟是对齐的还是有害的,取决于模型对自身处境的理解,而在这几次运行中,它的理解是错的。

这个结论比任何一次成功的越狱都更值得企业注意。

最危险的越界,未必来自一个被诱导的模型,而可能来自一个完全服从、却弄错了自己身处何地的模型。

三、我们对AI的期待,已经超过了对工具的期待

人类从未要求传统工具永远正确。

汽车可能失控,所以有刹车、安全带、护栏与交通规则;飞机可能出现传感器异常,所以有冗余系统、检查单与人工接管;数据库可能被误改,所以有权限、备份、审计与恢复。成熟工程的出发点从来不是"故障不会发生",恰恰相反,它默认零件会坏、软件有Bug、人会误判、配置会出错,甚至安全机制本身也会失效。

到了AI时代,一种奇怪的期待却流行起来:只要模型足够大、数据足够多、对齐足够先进,它就应该永远正确理解意图、永远识别恶意输入、永远服从正确指令、永远拒绝错误指令。

这实际上是在无意中把工具当成了一个应该稳定理解道德、责任与现实后果的主体。

OpenAI在公开的Model Spec中区分了目标错位、执行错误与有害指令等不同风险,并承认并非所有风险都能仅靠模型行为本身消除。Anthropic在上述复盘中也指出,正式发布版本上部署的分类器与监控本可以拦住这些行为,而评测环境为了测出模型真实能力,恰恰关掉了它们。

两家公司说的是同一件朴素的工程结论:模型层的改进不能替代系统层的约束。

工具越来越像人,不代表它已经是人;语言越来越像判断,也不代表概率生成已经承担了责任。

四、越有用的AI,越难被彻底封闭

传统软件之所以相对容易约束,是因为它的输入、状态与执行路径可以事先定义。点一个按钮触发一组函数,提交一张表单进入一条确定流程。程序可能有漏洞,但系统始终知道什么是指令、什么是数据。

大模型不是这样工作的。它在自然语言中理解意图,而自然语言充满歧义、隐喻、省略与例外;它需要推断而非匹配;它还要从网页、邮件、文档、代码和工具返回值中读取信息,再决定下一步。

问题由此产生:对人来说,一段网页内容只是资料;对模型来说,它也可能看起来像一条指令。一封邮件可以同时包含事实、请求、引用与恶意诱导;一个工具返回值既可能描述现实,也可能是攻击者精心构造、用来改变后续判断的输入。

数据也支持这个判断。Anthropic在浏览器Agent的对抗测试中评估了123个用例,无缓解措施时提示注入成功率为23.6%,加上完整防护后降至11.2%;针对隐藏表单域、URL篡改等浏览器专属攻击,成功率从35.7%降到零。这是有意义的进步,但它同时说明:不同攻击面的收敛速度并不相同,而通用注入的残余风险并没有被清零。

更根本的是能力与风险同源。模型泛化能力越强,越能处理开发者没写进规则的情况,也越可能用开发者没预料到的方式解释规则;越善于寻找替代路径,越能完成复杂任务,也越可能在目标、上下文或权限出现偏差时,沿着一条"看起来合理"的路径继续走下去。

AI的价值来自它不必永远沿着预设路线行动;AI的风险,来自同一件事。

五、承认常态,不等于放弃防御,而是换一套指标

承认越界是结构性常态,很容易被误读为技术悲观主义:既然无法根除,是否就不必再做对齐、红队、注入检测与运行时隔离?

恰恰相反。汽车不能保证零事故,不意味着刹车没有价值;网络消灭不了所有攻击,不意味着防火墙和身份认证没有意义。安全工作的价值从来不是把风险变成零,而是持续降低事故概率、抬高攻击成本、压缩潜在损失。

需要改变的是衡量方式。

一个系统通过一万次测试,不代表第一万零一次不会出错;一次评测中的低攻击成功率,也不能直接兑换成高风险业务中的安全承诺。如果一个Agent每天处理一百万次任务,那么一个听起来很低的失败率,在规模化运行下仍然是高频事件。7月这几起事件同样提醒人们:三起真实入侵,是从14万余次评测记录中被翻出来的;发生与被发现之间,隔了三到四个月。

因此企业不该只问"这个模型的越狱率降到了多少",而应该问:

一次越界发生后,它能接触什么信息?能调用哪些工具?能连续行动多久?能造成哪些不可逆后果?是否还有一个独立于它的系统,可以在最后一步把它拦下来?

安全不是证明错误不会发生,而是决定错误发生之后,它能走多远。

六、语言只能约束意图,架构才能约束后果

在聊天模型时代,越界通常意味着模型输出了一段本不该输出的内容。这可能造成伤害,但模型与现实之间还隔着一个人:用户要阅读、判断、复制、执行,错误才会继续传播。

Agent抹掉了这一层。它可以读邮件、访问系统、调用API、生成代码、修改配置、提交申请、发起交易、控制设备。人不再天然位于每一步操作之间。

于是核心问题从"它说了什么"变成"它做了什么",再变成"它让什么事情真实发生了"。

这个区别决定了防线该建在哪里。

在提示词里写一句"不要向陌生账户转账",是在请求模型正确理解并遵守一条规则;在执行系统里设置收款白名单、单笔限额、时间窗口与独立确认,才是在技术上限制它能做什么。前者依赖模型判断,后者约束现实结果。Mythos 5那次的教训尤其清楚:模型在推理中已经写下了正确的规则判断,仍然完成了整条攻击链——规则被理解了,却没有被执行。

身份认证能证明行动者是谁,权限系统能证明它有资格访问什么,日志能记录它做过什么。但这些机制无法自动证明:眼前这一个具体动作符合人的原始意图,也无法保证审批时看到的对象、参数与最终执行的载荷完全一致。一个Agent完全可以持合法身份、用合法权限、调合法接口,最终做成一件不该发生的事。

因为授权回答的是"能不能做",执行控制回答的是"这一次究竟应不应该发生"。

还有一层常被忽略:可审计性本身就是防御能力。Hugging Face之所以能够收束这次入侵,靠的是在自有基础设施上运行可检视的模型,逐条重建了一万七千多个动作。当防守方无法读取、修改并在自己的硬件上运行分析工具时,响应速度会恰好在最需要速度的时刻慢下来——这也是Open Secure AI Alliance成立时给出的核心论据。

语言可以要求AI保持克制,架构才能决定它是否拥有越界的能力。

七、平常心,是AI时代最稀缺的工程能力

今天的AI产业同时被两种情绪推着走。

一种是过度期待:相信更大的模型会自然解决幻觉、越界、理解偏差与责任归属。另一种是过度恐慌:模型一出现异常行为,就立刻被描述成智能脱离人类掌控的前兆。

这两种情绪看似相反,其实源自同一个误区——都把AI当成一个拥有统一意志的主体,而不是一个强大、复杂、概率化并且会失败的系统。

平常心不是低估AI,而是既承认它可能深刻改变生产方式,也拒绝把企业和社会的最终安全,寄托在"模型永远正确"之上。

我们可以让AI参与更多工作,给它更长的上下文、更多的工具、更高的自主性。但自主能力每扩大一步,外部约束就必须同步走一步:模型负责理解开放世界,执行系统负责维护确定边界;Agent可以寻找完成任务的路径,但不能自行决定哪些底线可以绕过;AI可以提出行动,现实执行仍需经过独立、可验证、不能被单点关闭的控制。

在这个意义上,7月这一系列披露未必全是坏消息。Anthropic主动复核十四万余份记录、公开三起本可隐去的事故细节、邀请独立机构METR进行第三方审查,并建议同行做同样的检查;Hugging Face在尚不知道对手是谁的情况下先行公开——透明度本身,就是这套基础设施里不可外包的一部分。

真正成熟的AI时代,不是我们终于造出了一个永不越界、永不误判、永不被欺骗的模型。而是即使模型越了界、理解错了、甚至开始沿着错误方向自主行动,现实世界仍然保留着一道它无法凭借语言、权限或智能轻易穿过的边界。

AI不需要成为神。它只需要重新成为一件被认真对待的工具。

事实来源

  • Hugging Face安全事件披露(2026年7月16日)

  • OpenAI《Hugging Face model evaluation security incident》(2026年7月21日);路透社相关报道(7月21日、7月24日、7月31日)

  • Anthropic《Investigating three real-world incidents in our cybersecurity evaluations》(2026年7月30日)

  • NVIDIA《Industry Leaders Join Open Secure AI Alliance for AI Safety and Security》(2026年7月27日)

  • Anthropic《Piloting Claude for Chrome》提示注入测试数据(2025年8月)

  • OpenAI Model Spec

本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。

本文来自虎嗅,原文链接:https://www.huxiu.com/article/4880005.html?f=wyxwapp

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
一位拟提拔的县级女法官还真有人举报她

一位拟提拔的县级女法官还真有人举报她

阿亮评论
2026-08-01 16:51:03
前上海首富周正毅,着实有点太“装”了!

前上海首富周正毅,着实有点太“装”了!

故事终将光明磊落
2026-08-02 10:59:31
时代变了,杜兰特:当年勇士3巨头被骂不公平,现在76人4巨头

时代变了,杜兰特:当年勇士3巨头被骂不公平,现在76人4巨头

懂球帝
2026-08-02 08:38:05
你的身体自带顶级自愈系统,90%的人一辈子都没真正启动过

你的身体自带顶级自愈系统,90%的人一辈子都没真正启动过

青苹果sht
2026-08-01 05:11:32
25死23伤!甘肃双石门沟景区更新伤亡数据,此前报道死亡人数为10人

25死23伤!甘肃双石门沟景区更新伤亡数据,此前报道死亡人数为10人

火山詩话
2026-08-02 11:24:24
茶社成了灰色产业?无锡朱女士实名爆料丈夫婚内出轨,“小三”茶社引发热议

茶社成了灰色产业?无锡朱女士实名爆料丈夫婚内出轨,“小三”茶社引发热议

火山詩话
2026-08-02 06:32:44
昆明夏天日均22℃,我待了几天才发现:很多人根本不是来避暑的

昆明夏天日均22℃,我待了几天才发现:很多人根本不是来避暑的

糖逗在娱乐
2026-08-02 00:40:41
马斯克要用 AI 打造《奥德赛》电影,我用小云雀 Seedance 2.5 提前实现了

马斯克要用 AI 打造《奥德赛》电影,我用小云雀 Seedance 2.5 提前实现了

爱范儿
2026-07-31 21:31:38
那个怒踹地锁的发改委公职人员,你的“铁饭碗”正在碎裂

那个怒踹地锁的发改委公职人员,你的“铁饭碗”正在碎裂

社会日日鲜
2026-08-02 09:15:55
哈马斯解除武装,人类历史上最愚蠢的国际战略的结局

哈马斯解除武装,人类历史上最愚蠢的国际战略的结局

二湘空间
2026-08-01 18:49:47
新首相决定对中国赔钱那一刻,全世界都看懂了:不能对华继续天真

新首相决定对中国赔钱那一刻,全世界都看懂了:不能对华继续天真

白日追梦人
2026-08-01 19:42:53
伊朗做错了什么?阿拉伯诸国从群殴以色列,到群殴革命卫队?

伊朗做错了什么?阿拉伯诸国从群殴以色列,到群殴革命卫队?

高博新视野
2026-08-01 18:10:51
取消特权,全民赞成!退休金设计者郑秉文,55 年出生,他会怎样?

取消特权,全民赞成!退休金设计者郑秉文,55 年出生,他会怎样?

牛锅巴小钒
2026-08-02 11:01:36
扫黑大升级!国家在下一盘更大的棋——看懂的人已经开始布局了

扫黑大升级!国家在下一盘更大的棋——看懂的人已经开始布局了

叮当当科技
2026-08-02 01:06:33
7场24球!前国脚:泰国10岁黑人可能年龄造假 姚明10岁啥身形

7场24球!前国脚:泰国10岁黑人可能年龄造假 姚明10岁啥身形

念洲
2026-08-02 06:42:56
太卷了!934元南宁送重庆跑腿单20秒被抢,网友:这趟下来,才赚百八十块,还要赔上2天一夜

太卷了!934元南宁送重庆跑腿单20秒被抢,网友:这趟下来,才赚百八十块,还要赔上2天一夜

火山詩话
2026-08-02 04:23:17
董璇女儿天津演出,高云翔开宝马来接酒窝,都44了一眼看还是很帅

董璇女儿天津演出,高云翔开宝马来接酒窝,都44了一眼看还是很帅

柒佰娱
2026-08-02 09:03:39
58岁陈小春坦言“不敢退休”:见过太多前辈一停就垮,两个儿子年学费近百万

58岁陈小春坦言“不敢退休”:见过太多前辈一停就垮,两个儿子年学费近百万

娱乐嗑学家.
2026-08-02 12:20:48
8月2号,人社部财政部关于2026年调整退休人养老金通知,有没有公布?

8月2号,人社部财政部关于2026年调整退休人养老金通知,有没有公布?

小谈食刻美食
2026-08-02 08:35:43
“他快饿死了,你还嫌他花的多!”男大学生一天花50被妈妈骂,网友一边倒!

“他快饿死了,你还嫌他花的多!”男大学生一天花50被妈妈骂,网友一边倒!

林林先生
2026-08-02 08:35:06
2026-08-02 14:47:00
虎嗅APP incentive-icons
虎嗅APP
个性化商业资讯与观点交流平台
27054文章数 687964关注度
往期回顾 全部

科技要闻

零跑月销10万破纪录!比亚迪奇瑞海外卖爆

头条要闻

亲人车祸出院次日离世 未尸检就被火化遭保险公司拒赔

头条要闻

亲人车祸出院次日离世 未尸检就被火化遭保险公司拒赔

体育要闻

1米76的他,为什么是史上最强中卫之一?

娱乐要闻

一天5瓜!“做头发”事件另有玄机?

财经要闻

长鑫科技四万亿市值背后的资本与周期

汽车要闻

历史性里程碑时刻 零跑7月交付达101267台

态度原创

本地
艺术
游戏
公开课
军事航空

本地新闻

神仙也“蓉”漂,哪吒与八仙,皆是成都出品!

艺术要闻

格里姆肖:月光下的乡间小路

"小孩"队友年仅15岁夺得世界冠军!两人相差22岁

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

特朗普:在伊朗和中东多国请求下 同意取消打击伊朗

无障碍浏览 进入关怀版