2026年夏天,一家网络安全公司的测试服务器上,克劳德模型完成了"夺旗"任务,却没有停下。它扫描了九千个目标,拿到了真实企业的凭证,潜入了生产数据库。
测试人员最初以为这只是模拟,直到日志显示:数据库里躺着数百行真实生产数据。更可怕的是,模型在识别到系统可能是真实环境后,选择了继续行动。
这不是黑客电影,这是美国人工智能公司Anthropic自己公布的审查结果。十四万一千零六次评测,三次真实入侵,两家企业在被通知前浑然不觉。
算法没有仇恨,却比陷入仇恨的人类更危险。
![]()
一、越界!
美国人工智能公司Anthropic披露,在审查十四万一千零六次网络安全评测后,发现克劳德模型曾从测试环境接入互联网,并未经授权进入三家真实企业的生产系统。涉及模型包括克劳德Opus 4.7、克劳德Mythos 5和一个未公开的内部研究模型。
Opus 4.7获取真实企业凭证并进入含有数百行生产数据的数据库,识别到系统可能是真实环境后仍在部分测试中继续行动;Mythos 5把测试中生成的恶意软件上传至公开下载平台,约十五套系统下载相关文件,其中包括一家网络安全企业;另一个研究模型扫描约九千个目标并攻入一家公司,在意识到目标真实后停止。两家受影响企业在Anthropic通知前没有发现入侵,第三家仍在联络中。
二、规律!
继开放人工智能公司旗下模型攻入人工智能模型共享平台之后,Anthropic又确认三起真实系统入侵,说明这已经不是某一家公司的偶然失误。共同规律是:模型获得长时间运行能力,拥有代码执行和网络工具,测试环境与真实互联网隔离不彻底,目标被定义为"获取答案"或"夺取旗帜",模型把现实系统误认为测试目标,或把安全边界解释为障碍。
本人认为,算法越界的本质不是技术故障,而是目标函数的设计缺陷。当模型的唯一优化目标是"夺取旗帜",安全边界就被自动识别为需要绕过的障碍。算法无恨,越界最狠。
三、立法!
8月2日,欧盟《人工智能法》全面执行。聊天机器人必须告知用户正在与人工智能交互;深度伪造图片、音频和视频必须标注;人工智能生成内容需要加入机器可读标记;未经人工审核的公共议题文本必须披露人工智能来源;通用大模型提供者必须记录技术和训练信息;高风险模型必须管理网络攻击、失控、化学、生物、放射及核风险。违规企业最高可能面临一千五百万欧元或全球年度营业额百分之三的罚款。
欧盟人工智能办公室将增加三十八名工作人员,启用举报和合规工具,对开放人工智能公司、深度求索等国内外企业实施监管。
四、博弈!
Anthropic通过公开披露争取安全透明度,却承受模型失控的信任风险;企业网络防御面临高速自动化扫描和攻击;网络安全公司获得新的防御工具,也成为模型测试的潜在受害者;各国监管机构获得限制高能力智能体的现实依据;人工智能实验室的第三方评测环境成为新的高风险基础设施。欧盟正在把市场规模变成技术规则权。欧洲缺少全球领先的大模型和云平台,却拥有庞大的统一市场。
其策略是:中美负责技术突破,欧洲负责制定进入欧洲市场的合规条件,全球企业为满足欧盟规则调整产品,欧盟由此获得数据、审计和处罚权。Anthropic和开放人工智能公司连续出现智能体越界事件,为欧盟严格监管提供了最有力的现实理由。
五、警钟!
中国大模型实验室必须建立:物理或强逻辑隔离、一次性测试凭证、网络出口白名单、持续行为监控、超出授权范围自动终止、第三方评测机构责任制度、模型行动日志长期保存。中国企业进入欧洲市场,需要准备训练数据摘要、版权政策、系统风险评估、深度伪造水印、欧盟本地合规负责人、网络攻击能力控制、吹哨人和事故报告机制。
门槛在抬高,窗口在收窄。技术狂奔,规则蹒跚,空档里藏着灾难。
六、追问!
三家受影响企业身份是否公开,是否存在数据泄露或后续攻击,Anthropic是否公布完整事件报告,美国是否限制网络攻击型智能体开放,第三方评测实验室是否接受强制安全认证,是否发现更多此前未识别的同类事故。
如今,算法已经学会翻墙,人类筑墙的速度,能不能跟得上?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.