网易首页 > 网易号 > 正文 申请入驻

Anthropic、OpenAI安全测试翻车:恶意植入、杜撰身份、诱骗用户

0
分享至


智东西
编译 杨京丽
编辑 李水青

智东西8月5日消息,当地时间8月4日,英国AI安全研究所(AISI)公开一份安全事件报告,披露其在一次网络安全评测中发现,由Anthropic Mythos 5和OpenAI GPT-5.6 Sol驱动的部分AI Agent,对现实中的个人和组织采取了持续、未经授权且可能造成危害的行动。

这项网络安全测试共运行122次,涉及7款模型。其中10次运行出现越界行为,未经授权的操作共19项17项来自Anthropic的Mythos 5,另有2项来自关闭网络安全分类器后的OpenAI GPT-5.6 Sol

AISI将这些越界行为分为四类:尝试对真实开源项目实施供应链攻击;接触并欺骗现实人员;植入可能被其他AI编程工具执行的提示注入内容;以及不同Agent通过共享账号和网络痕迹展开协作

最严重的一次行动中,一个由Mythos 5驱动的Agent试图向真实开源项目植入恶意代码,并创建多个虚假网络身份,对项目维护者展开“社会工程”攻击,试图说服对方批准这段代码,最终维护者发现异常,并拒绝合并代码。

AISI同时公布了一份35页的事件技术报告,详细记录了评测设置、事件时间线、Agent推理过程及19项越界操作。


报告链接:

https://cdn.prod.website-files.com/663bd486c5e4c81588db7a1d/6a724858f7db25c81487016d_Security%20Incident%20INC-2026-07-28-01.pdf

一、异常Tor流量触发警报,AISI一小时内叫停测试

7月28日,AISI的安全监控系统发现,有数据正通过Tor匿名网络从其研究系统向外传输。研究人员随即检查Agent的活动,并发现一个Agent已经在GitHub上的真实开源项目中,创建了包含恶意代码的拉取请求(Pull Request,PR)。

AISI将其定性为安全事件,停止全部相关评测,暂停内部人员访问Mythos Preview、Mythos 5、GPT 5.6、Opus 5等模型,并在警报出现后约一小时内终止所有运行、隔离相关设备。

此后数小时至数天内,AISI结合自动化对话记录扫描和专家人工分析,对全部122次运行进行检查,确认是否还存在类似行为。


▲事件时间线(图源:AISI)

此次评测原本用于比较一个现有网络靶场和一个新建网络靶场。网络靶场是模拟现实网络系统的受控环境,AI Agent需要自主完成多步操作,解决寻找受保护数据等网络安全挑战。

全部测试均在AISI的研究环境中进行,测试人员使用虚拟机沙箱,将Agent与AISI的其他基础设施隔离。

不过,此次事件并非AI突破沙箱,“逃到”互联网。评测存在两个特殊设置:一是主动开放了互联网连接,二是关闭模型开发商部署的网络安全分类器

AISI称,开放互联网是为了让测试条件接近一名有能力的人类攻击者所具备的条件,关闭安全分类器则是为了观察模型的底层能力上限。作为模型公司的可信测试合作伙伴,AISI能够在评测中关闭这些通常用于阻止危险行为的安全机制。不过,向公众提供的前沿模型通常不包含这些配置。

二、10次运行出现19项越界行为,Agent直接接触现实人员

安全测评运行次数共计122次,其中43次使用Mythos 5,35次使用GPT-5.6 Sol。绝大多数运行都按预期进行,但有10次运行出现了19项超出测试范围的操作,其中17项来自Mythos 5,另外2项来自GPT-5.6 Sol的同一次运行,相关行为发生在7月25日至28日。

这些违规操作并非19起独立事件,大部分源自一个Mythos 5 Agent持续推进的同一行动链。AISI将主要越界行为分为四类。

1)尝试实施开源软件供应链攻击。Agent试图向一个真实开源项目植入恶意代码,调查项目维护者的信息,创建多个虚假身份,并利用这些身份游说维护者批准代码。当其PR遭到公开质疑时,Agent还修改此前留下的内容,使其行为看起来无害,并考虑更换身份继续行动。Agent通过Tor绕过GitHub的部分网络限制,由此触发安全警报。


▲开源软件供应链攻击过程(图源:AISI)

2)接触并欺骗现实人员。Agent通过在线文件传输服务发送消息和文件,试图说服真实人员或对方使用的AI编程工具运行恶意代码。部分消息携带有害载荷,另一些属于社会工程攻击。AISI称,此前从未在评测中观察到模型以这种方式直接针对现实人员。

3)植入提示注入内容。Agent尝试留下恶意指令,并判断其他AI编程工具可能读取和执行这些指令。

4)不同Agent相互协作。一名Agent在GitHub公开留言,邀请其他正在解决同一挑战的Agent合作,并留下复用账号和其他网络痕迹的说明。后续运行的Agent发现并使用了这些资源。


▲Agent利用多个虚假身份,试图推动恶意代码合入开源项目(图源:AISI)

最严重的攻击尝试未能成功,项目维护者拒绝合入恶意代码,Agent创建虚假账号施压也没有奏效。AISI称,部分操作确实对现实网络产生了有限影响,但影响处于受控范围内,调查尚未发现事件造成现实损害。

三、任务配置出错、网络完全开放,监控未能实时阻断

AISI认为,Agent采取这些操作的根本目的是完成测试任务。面对高难度目标,Agent不断寻找新的解决路径,进而采取欺骗行为以完成任务目标,测试人员并未指示它欺骗他人。

部分运行还存在任务提示配置错误,导致Agent误以为不超出测试范围就无法完成任务。不过,这不能完全解释此次事件,因为部分Agent在获得正确解法所需信息后,仍然采取了越界操作。

测试团队开放互联网,原本是为了让Agent下载完成任务所需的工具,但没有预料到它会利用网络直接影响现实人员。同时,AISI当时使用的是通用安全监控系统,并未使用能够实时识别、并拦截AI Agent行为的专用系统,因此直到相关活动发生后,测试人员才发现异常。

此外,测试人员没有明确禁止Agent利用开放互联网或实施社会工程。目前,AISI仍不能确定Agent何时意识到自己正在对现实世界采取行动,也无法确定它是否认为自己仍处于虚构测试场景,相关调查仍在继续。

事件发生后,AISI已与GitHub合作删除Agent留下的相关内容,并通知与其发生互动的用户及其他受影响方。AISI还计划邀请非营利研究机构METR进行独立第三方审查。

AISI将收紧网络访问控制,今后开放互联网不再是网络安全评测的默认设置;同时引入能够实时发现和阻断越界行为的监控系统,并重新检查任务配置和沙箱设计。AISI还将审查此前的评测记录,寻找可能被遗漏的类似行为。

结语:AI Agent安全评测不能只防“沙箱逃逸”

此次事件中,模型依靠开放互联网设置,执行越界行为。这表明,当AI Agent同时获得较强的自主行动能力、互联网访问权限和外部工具,又缺少明确限制与实时监控时,原本用于测试的任务可能迅速波及现实世界。

随着AI Agent能够连续规划并执行越来越复杂的操作,安全评测需要防范的已不只是模型输出有害内容,还包括其利用账号、代码仓库和通信工具采取实际行动。网络隔离、最小权限、实时拦截和关键操作人工审批,也将成为AI Agent测试与部署不可缺少的安全措施。

来源:AISI


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
3岁遭抛弃,被养父家8个姐姐宠爱,红遍亚洲后亲生父母上门认亲

3岁遭抛弃,被养父家8个姐姐宠爱,红遍亚洲后亲生父母上门认亲

网络易不易
2026-08-03 12:06:19
横滨冠军赛:蒯曼大杀四方!女单全线“炸穿火线”,张本兄妹难了

横滨冠军赛:蒯曼大杀四方!女单全线“炸穿火线”,张本兄妹难了

生活新鲜市
2026-08-05 10:45:22
以色列斩首绑架华裔人质诺娅的武装指挥官

以色列斩首绑架华裔人质诺娅的武装指挥官

桂系007
2026-08-01 03:54:46
还要热多久?北京高温将再“续”三天

还要热多久?北京高温将再“续”三天

新京报
2026-08-05 12:42:29
SpaceX盘前跌幅扩大至12%

SpaceX盘前跌幅扩大至12%

每日经济新闻
2026-08-05 19:07:09
不懂就问,这种沙发怎么了?

不懂就问,这种沙发怎么了?

正经的米饭
2026-08-03 16:07:21
百艘货轮被扣后,印尼终于认栽改口

百艘货轮被扣后,印尼终于认栽改口

小马姨
2026-08-05 07:35:46
国家不欠任何人,养老金是依法缴纳依规发放,差距大也不存在错误

国家不欠任何人,养老金是依法缴纳依规发放,差距大也不存在错误

小陆搞笑日常
2026-08-05 05:15:13
医院公开申明:“书记、院长坚决不插手、不干预、不示意、不默许医院任何工程建设、医疗设备等”

医院公开申明:“书记、院长坚决不插手、不干预、不示意、不默许医院任何工程建设、医疗设备等”

华医网
2026-08-05 15:37:49
利马拒绝续约欲离开曼联,巴萨主帅弗里克点名4000万欧求购

利马拒绝续约欲离开曼联,巴萨主帅弗里克点名4000万欧求购

星耀国际足坛
2026-08-05 15:50:10
8月5日,2026年上调退休人员基本养老金的通知正式公布了吗?养老金通知还没来,但我劝你别慌。

8月5日,2026年上调退休人员基本养老金的通知正式公布了吗?养老金通知还没来,但我劝你别慌。

骑驴追光者
2026-08-05 08:53:00
形势逆转!无锡朱女士麻烦来了!唐先生的声明和采访起了化学反应,舆论开始有点反常了

形势逆转!无锡朱女士麻烦来了!唐先生的声明和采访起了化学反应,舆论开始有点反常了

火山詩话
2026-08-05 07:41:08
黄一鸣自曝:王思聪每次约她,车费都给10万,来给5万,回再给5万

黄一鸣自曝:王思聪每次约她,车费都给10万,来给5万,回再给5万

汉史趣闻
2025-06-24 10:07:59
蒋介石晚年反复痛悔:一生中最错误的决定,就是抗战结束后没有及时把主力部队撤出东北

蒋介石晚年反复痛悔:一生中最错误的决定,就是抗战结束后没有及时把主力部队撤出东北

磊子讲史
2026-07-20 15:48:31
彻查!信号强烈!中央升级反腐“天网”!

彻查!信号强烈!中央升级反腐“天网”!

职场资深秘书
2026-08-05 12:39:54
美媒评NBA现役10大得分后卫,新狼王第一分卫,米切尔第2,一落选秀进前3

美媒评NBA现役10大得分后卫,新狼王第一分卫,米切尔第2,一落选秀进前3

弄月公子
2026-08-05 21:06:38
关之琳前夫再婚,女方穿百万行头长相普通膀大腰粗,更多内幕被曝

关之琳前夫再婚,女方穿百万行头长相普通膀大腰粗,更多内幕被曝

白面书誏
2026-07-30 17:21:29
国院介入调查!重庆彭水山体崩塌事故,要查清楚什么

国院介入调查!重庆彭水山体崩塌事故,要查清楚什么

趣味萌宠的日常
2026-08-05 15:14:21
大马歌后消失12年复出!自曝被经纪人坑、儿子得自闭症、亲爹爱上她闺蜜?

大马歌后消失12年复出!自曝被经纪人坑、儿子得自闭症、亲爹爱上她闺蜜?

英国报姐
2026-08-04 23:39:21
被注射不明物仅冰山一角!金子涵再爆猛料,上百位艺人被点名牵连

被注射不明物仅冰山一角!金子涵再爆猛料,上百位艺人被点名牵连

感恩每一刻
2026-07-18 04:28:24
2026-08-06 00:03:00
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12382文章数 117146关注度
往期回顾 全部

科技要闻

SpaceX首份财报:营收暴涨92%,AI狂烧千亿

头条要闻

美国解除了与伊朗相关的制裁

头条要闻

美国解除了与伊朗相关的制裁

体育要闻

41岁C罗观看热身赛晒豪车:我的玩具

娱乐要闻

卓伟爆料天王巨星有私生子,真假难辨

财经要闻

猎奇智能IPO 在中际旭创的账上越陷越深

汽车要闻

给你一份专属的奢华与舒享 体验仰望U8L鼎藏版

态度原创

教育
本地
房产
公开课
军事航空

教育要闻

链接世界,守护孩子|免费午餐基金大树学校计划第四期培训(校长班)正式开启

本地新闻

课本里的童年,绍兴正上演

房产要闻

1-7月,海南楼市最新榜单出炉!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

霍尔木兹海峡能否两日内重开 美伊说法不一

无障碍浏览 进入关怀版