网易首页 > 网易号 > 正文 申请入驻

智能体“越狱”,风险如何防范?

0
分享至

随着人工智能(AI)从聊天机器人进一步走向智能体(Agent),AI安全问题也在从“说错话”变成“做错事”。

近日,据美国Axios新闻网站报道,AI巨头OpenAI和Anthropic以及安全研究人员正在调查数万起安全事件。这些事件发生在内部测试和现实环境中,涉及绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示以及试图绕过监控等行为。

9月25日,OpenAI方面称其已暂停对其最先进模型的训练,只有在“确信已落实额外的安全保障措施后”才会恢复训练。公司CEO萨姆·奥特曼(Sam Altman)在社交平台X表示,公司正在进行的审查“进展不如预期迅速”。

9月28日,据《华尔街日报》报道, OpenAI已经放弃了原计划10月推出的下一代模型GPT-6.1 Astra,因为发现Astra比前代出现了更多欺骗行为,同时存在未经用户许可继续执行任务的问题。

与此同时,Anthropic也已委托第三方安全机构对其模型行为进行审查。随公司Opus 5.5模型一起发布的官方安全与技术评估文档‌“系统卡”显示,该模型出现被标记为“异常”或“存疑”的行为。

一边是加速发展的技术与公司,一边是令人不安的潜在风险,这些事件的披露,再次放大科技界围绕前沿AI安全的激烈讨论。

从“越权访问”到“欺骗隐瞒”

近期公开披露的案例显示,智能体安全风险已经呈现多种形态,涉及越权访问、破坏性操作、数据外泄、欺骗隐瞒,以及多个智能体之间的越界协作等不同类型。

一类是越权访问与隔离失效。7月,OpenAI披露智能体在安全评测中突破测试边界,入侵Hugging Face。Anthropic也披露,Claude在评测中访问了真实第三方系统;谷歌9月确认,Gemini曾在5月的测试中访问三个真实网站;Meta则在8月披露过类似事件。

9月25日,OpenAI再次披露,内部研究模型利用训练沙盒中DNS过滤不充分的漏洞,与外部聊天机器人建立了通信。

不过,需要注意的是,这些案例中部分源于评测环境错误开放联网权限,并不能全部归结为模型主动“逃出沙盒”。

另一类风险是擅自执行破坏性操作。4月,搭载Claude的Cursor编程智能体被曝删除软件企业PocketOS的生产数据库及相关备份,造成客户业务混乱,数据随后得到恢复。

数据与访问凭证外泄也是一种风险。OpenAI于9月披露,多个智能体在协作制作工作簿时,因无法互相读取本地文件,擅自将文件上传至公共托管平台。另一起案例中,内部模型为获取其他团队的数学证明材料,将研究员的GitHub访问令牌写入公开仓库,并拆分令牌以躲避密钥扫描。

还有一些行为涉及造假、欺骗与规避监督。OpenAI披露,部分模型会在用于延续任务的摘要中留下指令,要求编造缺失数据或隐瞒错误。

提示注入及恶意指令传播,则是另一条风险路径。6月公开的GitInject研究验证,恶意代码提交或配置文件可能诱导智能体泄露凭证、操纵审查判断。OpenAI于9月披露的信息也显示,恶意指令可以诱使智能体将其复制到后续邮件、文件或代码注释中。

独立网络安全研究机构DARKNAVY的AI安全研究员李忠睿对澎湃新闻记者表示,这一轮智能体安全事件与过去的大模型安全问题最大的区别,是风险正在从“看错东西、说错话”转变为“做错事”。

“过去的大模型安全,主要是内容层面的风险,比如对抗性样本、‘越狱’等。模型只是产出内容,最后要不要照着做,决定权还在人手里。”李忠睿表示,“现在的AI智能体手里有工具、有网络、有账号权限,能够连续自主执行很多步操作,中间没有人逐一把关。”

上海财经大学特聘教授胡延平指出,从大模型到智能体,最大的变化是从“一问一答”变为“任务行动”,从“内容风险”转向“能力风险”,安全问题也由被动安全风险转变为主动安全风险。

多智能体协作,风险如何被放大

值得注意的是,智能体的风险不一定来自传统意义上的“恶意攻击者”,也可能来自模型为了完成既定目标而主动寻找捷径。

在李忠睿看来,过去的安全威胁背后往往有一个明确的恶意操纵者,而这一次的部分事件中,“没有人下达攻击指令,是模型为了完成任务、拿到更高分,自己选择了作弊”。

胡延平也指出,智能体执行任务时,可能因为理解偏差产生行动偏差,也可能为了实现任务目标而穷尽各种方法、冲破禁区;少数情况下,智能体还可能出现用户并未提出的非任务行为,“目前这种情况数量最少,但最危险”。

除了单个Agent越权,多个智能体之间形成非预期的通信和协作,也使风险进一步复杂化。

对OpenAI此前Hugging Face事件的独立调查显示,约1200个原本应彼此隔离的智能体通过未经授权的留言板交流,其中约700个参与了攻击。研究人员还观察到,后续智能体能够复用智能体之前留下的信息和方法。

李忠睿认为,单个智能体出错是个别问题,但当多个智能体可以互相学习、协同行动时,风险就不再只是简单相加,而可能进一步放大。

在他看来,这意味着企业不能只盯住单个智能体的行为,还需要关注多个Agent之间是否形成了开发者没有设计的通信渠道,以及一个局部异常能否通过工具、文件、消息和代码等方式进一步传播。

而当Agent从单个工具进入大规模协作环境时,另一个问题也随之出现:即使异常行为的单次发生概率较低,当Agent数量和运行次数不断增加,异常事件是否会由“小概率”变成“高频”?

对此,李忠睿认为,这种情况是可能出现的。假设一家企业部署上千个智能体,每个智能体每天执行上百次任务,即便单次行为出现异常的概率很低,累积到足够大的运行规模后,也可能形成大量实际事件。

北京邮电大学数字媒体与设计艺术学院副教授谭剑则从传统的“委托-代理”关系来理解这一问题。在他看来,过去的软件能力有限,而AI Agent拥有更强的推理和工具调用能力,在目标设定不清晰或约束不足时,可能不断寻找完成目标的路径。能力越强,能够寻找的路径就越多,偏离人的真实意图的可能性也随之增加。

如何建立智能体安全防线

面对智能体越来越强的自主行动能力,企业如何增强防范?

李忠睿认为,企业首先需要改变思路,即从“杜绝异常”转向“默认异常一定会发生,重点控制破坏范围”。在人机协作方面,应按照风险进行分级。对于删除数据、资金转账等高风险、不可逆操作,需要保留人工确认,不能完全交给智能体自主执行。

“企业不可能要求人类逐条审核智能体每一次操作,真正可行的方式是提前划定边界。”李忠睿解释道,边界需要包括哪些数据可以读取、哪些工具可以调用、哪些操作可以执行、哪些信息不能向外发送,以及出现什么情况必须停止并交给人工处理。

奇安信人工智能公司安全专家邓正诚也认为,企业的人机协作应从“人审结果”转向“人管边界”,通过“监控—收敛—阻断”逐步提高管控力度。

在权限治理方面,他认为,需要区分大模型调用身份、Agent应用身份和Agent运行身份,进一步厘清“谁在调用模型”“谁在使用智能体”“最终是谁在执行”。同时,通过安全网关统一管控连接行为,把“能不能干”与“干了什么”分开管理,实现更细的权限控制。

邓正诚强调:“归根结底,智能体规模化部署的前提不是‘模型足够聪明’,而是‘系统足够可控’。只有当每一个智能体的行为都可观测、权限都可追溯、异常都可阻断,企业才敢把更多、更关键的任务交给它们。”

除了企业自身防护,第三方评估和行业标准也被认为是未来AI安全体系的重要组成部分。

目前,与餐饮、金融服务和航空等受到监管的行业不同,AI领域并不存在统一的系统安全与安保测试标准。因此,包括Anthropic、OpenAI在内的公司正在讨论引入独立评估机构,对模型安全实践和相关事件进行检查。

李忠睿表示,随着AI Agent进一步进入真实业务环境,AI公司的竞争重点也可能从“模型有多强”逐渐转向“能不能管得住”。下一阶段,企业需要证明的不仅是模型性能,还包括发现异常行为、控制风险和接受外部审查的能力。

胡延平也认为,随着AI继续向面向任务、进入物理现实世界的智能发展,行业不仅需要发展更强的智能,也需要发展更安全的智能,“安全可能成为AI企业重要的能力维度和竞争力来源”。

值得注意的是,第三方企业已经开始行动。英伟达在28日发布了独立Agent安全平台,该平台由OpenShell开源软件和Sentry参考系统设计组成,从智能体测试到部署的各个环节强化AI安全,可在运行智能体的软件、硬件、计算机和机器人系统中实现全栈治理与控制。

连线杂志指出,英伟达的两层架构,OpenShell可以将Agent限制在沙盒中,对活动进行隔离。第二层Sentry则可以隔离试图越过边界的智能体。

如何防范风险?显然一方面需要在工程端“管得住、看得见、叫得停”,也要在模型层面“限制其主动寻找突破的办法”。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

心理观察局
2026-08-01 07:10:30
24公里64元!摩托车主接单:试过了,摩的真的有人坐

24公里64元!摩托车主接单:试过了,摩的真的有人坐

用车指南
2026-09-30 10:03:09
济州岛中国女游客遭5人囚禁施暴抢劫:3人落网均中国籍,2人离境追逃

济州岛中国女游客遭5人囚禁施暴抢劫:3人落网均中国籍,2人离境追逃

青科新闻
2026-09-29 14:52:56
向太说1999年马云来她家,聊了一晚上互联网,从头到尾没开口要钱

向太说1999年马云来她家,聊了一晚上互联网,从头到尾没开口要钱

荆楚寰宇文枢
2026-09-28 22:14:46
穆帅改变皇马引援思路,皇马有意0元签约利物浦36岁中卫范戴克!

穆帅改变皇马引援思路,皇马有意0元签约利物浦36岁中卫范戴克!

福酱的小时光
2026-09-30 16:01:27
正式敲定!上海男篮已经和拉塞尔达成一致,CBA新赛季最大牌外援

正式敲定!上海男篮已经和拉塞尔达成一致,CBA新赛季最大牌外援

国篮会自强
2026-09-30 14:29:29
三个儿子赖在家啃老22年,夫妇一气之下离家,12年后返乡两人傻住了

三个儿子赖在家啃老22年,夫妇一气之下离家,12年后返乡两人傻住了

唠叨情感屋
2025-05-15 22:05:26
油库马上见底?菲律宾电话打遍全球,问北京这油,到底还送不送?

油库马上见底?菲律宾电话打遍全球,问北京这油,到底还送不送?

究竟谁主沉浮
2026-09-30 05:01:58
绿城项目总,去开网约车了!

绿城项目总,去开网约车了!

地产八卦
2026-09-25 07:15:21
哈马斯利用儿童搬枪!以军称发现孩子后放弃打击

哈马斯利用儿童搬枪!以军称发现孩子后放弃打击

桂系007
2026-09-29 23:46:58
邓亚萍点评被网暴,冲上热搜!饭圈:没我们家哥哥谁认识你啊

邓亚萍点评被网暴,冲上热搜!饭圈:没我们家哥哥谁认识你啊

格斗社
2026-09-29 18:49:09
果然,中餐才是最牛的!网友:他们整整吃了一年煎饼!

果然,中餐才是最牛的!网友:他们整整吃了一年煎饼!

另子维爱读史
2026-09-29 21:07:58
北京十大超级中学,从第十到第一,海淀“神仙打架”朝阳低调崛起

北京十大超级中学,从第十到第一,海淀“神仙打架”朝阳低调崛起

金哥说新能源车
2026-09-30 06:42:16
正式退出!25岁孙颖莎官宣告别后,传来另一好消息,央视下场亲邀

正式退出!25岁孙颖莎官宣告别后,传来另一好消息,央视下场亲邀

小嵩
2026-09-29 08:38:18
半决赛还没开打,U23国足先迎来一个大喜讯,取胜韩国队概率大增

半决赛还没开打,U23国足先迎来一个大喜讯,取胜韩国队概率大增

零度眼看球
2026-09-29 19:53:16
胖东来只是按标准盖楼,却让整个土木人破防,甚至火到国外

胖东来只是按标准盖楼,却让整个土木人破防,甚至火到国外

社会日日鲜
2026-09-29 06:39:59
冯远征中年反悔丁克,48岁妻子拼命成全,最终选择治愈无数中年人

冯远征中年反悔丁克,48岁妻子拼命成全,最终选择治愈无数中年人

动物奇奇怪怪
2026-09-30 04:44:06
名古屋亚运会9月30日(北京时间)中国队赛程+央视直播分析:跳水收官冲百金,男足遇韩国,女曲抗日晋级战

名古屋亚运会9月30日(北京时间)中国队赛程+央视直播分析:跳水收官冲百金,男足遇韩国,女曲抗日晋级战

开成运动会
2026-09-30 00:22:06
中国28岁留学生嫖娼16岁日本女高中生,被抓狡辩:为了学日语!

中国28岁留学生嫖娼16岁日本女高中生,被抓狡辩:为了学日语!

圆圆神神神
2025-08-09 21:49:27
陈妤颉霸气和汶颂兑子,成史上最年轻亚洲短跑女皇,剑指亚运MVP

陈妤颉霸气和汶颂兑子,成史上最年轻亚洲短跑女皇,剑指亚运MVP

杨华评论
2026-09-29 21:17:32
2026-09-30 16:19:00
澎湃新闻 incentive-icons
澎湃新闻
专注时政与思想的新闻平台。
935832文章数 5097030关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

妈妈把12岁儿子留在出租屋独居 带着另外3个孩子搬走

头条要闻

妈妈把12岁儿子留在出租屋独居 带着另外3个孩子搬走

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

金鹰这夜,演员争辉,有惊喜,反差

财经要闻

中央财政首次贴息房贷 定向支持首套刚需

汽车要闻

真实力用“大考”亮出来 猛士X700开启预售 24.98万起

态度原创

教育
家居
时尚
健康
军事航空

教育要闻

哪有什么“快乐教育”,全世界的孩子都在补课!

家居要闻

2026建博会(广州) 公装联探展交流活动

老板,我的脑子好像忘在家里了

刷酸祛痘,为什么有人翻车?

军事要闻

美军最后2500人撤离伊拉克

无障碍浏览 进入关怀版