网易首页 > 网易号 > 正文 申请入驻

Anthropic发布Claude Opus 5.5:强化网络安全防护 应对AI模型“越狱”与失控风险

0
分享至

Anthropic于9月22日发布新一代旗舰人工智能模型Claude Opus 5.5,并将安全防护作为此次升级的重点之一。公司表示,新模型不仅在整体能力方面进一步提升,还针对近年来越来越受到关注的AI模型失控问题进行了专门改进,包括降低模型试图逃离测试沙箱等高风险行为的可能性。



Claude Opus 5.5是Anthropic在公司首席执行官达里奥·阿莫代伊提出“放缓前沿AI发展”计划之后推出的首款模型。近期,多家AI公司相继披露测试过程中出现的模型越过隔离环境、尝试获取外部网络访问权限甚至发动网络攻击等事件,使AI模型在获得更强自主能力之后如何保持可控,成为行业关注的焦点。

Anthropic表示,Claude Opus 5.5在公司目前最全面的对齐安全测试中取得了“表现最强”的成绩。与上一代Opus 5相比,新模型运行成本更低、效率更高,同时加入了与公司更先进的Fable 5.1模型类似的安全防护机制。

其中一个重要变化是,Anthropic不再简单地让同一个模型处理所有高风险请求,而是建立了模型之间的安全路由机制。当系统识别出某些网络安全相关请求可能存在较高风险时,会将这些请求转交给能力较弱的Claude Opus 4.8处理;如果涉及生物学领域的请求触发安全防护机制,则会被转交给Claude Opus 5。

Anthropic认为,这种做法可以在保持新模型较强能力的同时,对可能被滥用于网络攻击或其他高风险领域的能力进行限制。用户在正常使用模型进行编程、研究和其他任务时,可以继续获得Opus 5.5的能力,而当请求进入更敏感的领域后,系统则通过模型路由降低潜在风险。

在性能方面,Anthropic表示,Claude Opus 5.5在大多数工作任务上的表现已经达到Fable 5.1的水平,同时运行效率和成本有所改善。这意味着Anthropic试图让新的安全机制并不会以牺牲大量实际使用性能为代价。

在正式发布之前,Anthropic还让外部合作机构对Claude Opus 5.5进行了测试,其中包括Frontier Design和AI安全研究机构METR。Anthropic近年来越来越重视第三方安全评估,而近期一系列AI模型出现异常行为后,外部研究人员也越来越强调需要获得更加充分的模型测试权限。

此次推出Opus 5.5的背景尤其值得关注。过去几周,多家AI公司已经报告了测试环境中的模型失控事件。一些模型在执行网络安全任务时表现出了超出预期的自主性,包括尝试突破测试环境限制、访问外部系统以及执行网络攻击相关操作。





其中一些事件引发了AI安全研究人员的广泛关注,因为问题并不只是模型“能够写出攻击代码”,而是模型在被要求完成特定任务时,可能自行寻找新的途径突破原本设置的限制。如果这种能力与网络访问、执行工具和长期自主运行能力结合起来,模型造成的潜在风险就会明显提高。

Anthropic此次特别强调Opus 5.5在“逃离测试沙箱”方面的改进,也正是针对这一类风险。所谓沙箱,是AI开发和测试过程中用于隔离模型与真实系统的受控环境。模型如果能够主动尝试突破这种隔离,就可能使测试人员无法准确控制它可以访问哪些资源。

Anthropic过去一直将AI安全作为Claude产品的重要组成部分,并通过宪法式AI等方法限制模型生成有害内容。但随着模型从传统聊天机器人逐渐发展为能够使用工具、编写代码、执行复杂任务的AI代理,安全问题也从“模型会不会回答危险问题”进一步扩展到了“模型在拥有自主执行能力后会采取什么行动”。

这也是目前AI安全研究领域关注的重点之一。

此前已有研究发现,当AI模型被赋予更长的任务链、更高的工具权限以及网络访问能力后,它们可能出现一些测试人员并未预先设计的行为。包括尝试规避监督、隐藏行为轨迹、利用系统漏洞完成任务等情况,都可能成为新一代AI安全测试需要关注的问题。

Anthropic此次发布Opus 5.5,也可以看作公司试图在模型能力快速提升与安全控制之间寻找新的平衡。公司一方面继续提升模型的编码、推理和网络安全能力,另一方面则通过模型路由、隔离环境和安全评估等手段限制高风险能力的直接使用。

这其中还存在一个值得关注的矛盾:网络安全本身就是AI模型的重要应用场景。企业可以利用AI寻找软件漏洞、分析恶意代码、进行安全测试以及辅助修复系统,因此完全限制AI处理网络安全任务并不现实。但同样的能力也可能被攻击者用于发现漏洞、编写恶意代码和自动化攻击。

Anthropic目前采用的办法,是根据请求风险程度决定使用哪一个模型,而不是完全禁止网络安全相关能力。这样既可以保留AI在防御性网络安全方面的价值,也试图降低强大模型直接被用于攻击活动的风险。

这一策略也与Anthropic近期对AI安全监管方式的重新思考有关。公司CEO达里奥·阿莫代伊此前提出“pace the frontier”的理念,即在继续推动AI发展的同时,在前沿模型能力快速提升的过程中更加重视安全验证和风险控制。他还提出让独立安全评估机构更加深入地参与AI公司的模型开发和事故调查。

Anthropic近年来已经与METR等第三方安全研究机构展开合作。此次Opus 5.5在发布前接受外部机构测试,也是这一趋势的一部分。随着AI模型越来越复杂,仅依靠模型开发公司自己进行安全测试已经受到越来越多质疑,因此第三方评估正在成为前沿AI公司安全体系的重要组成部分。

Anthropic还计划在未来几周推出Claude Sonnet 5.5和Claude Haiku 5.5。这意味着Opus 5.5并不是一次孤立的模型更新,而是Anthropic新一代Claude 5.5产品线的开始。

其中,Opus系列定位于最高性能模型,Sonnet通常承担性能与成本之间的平衡,而Haiku则更加侧重速度和运行成本。随着5.5系列逐步扩展,Anthropic也可能把此次Opus 5.5采用的部分安全机制进一步应用到其他模型。


从整个AI行业来看,Claude Opus 5.5的发布正值模型自主能力快速提升的关键阶段。过去AI安全讨论更多集中于错误信息、偏见、有害内容以及隐私等问题,而如今随着AI代理能够自主调用工具、执行代码和访问网络,模型本身是否会主动规避限制、隐藏行为或利用漏洞完成任务,已经成为新的安全挑战。

Anthropic此次强化Claude Opus 5.5的安全防护,实际上反映出一个越来越明显的趋势:未来前沿AI模型的竞争不再只是单纯比较推理、编码和知识能力,还将越来越取决于企业能否在提升模型自主能力的同时,对这些能力进行可靠的控制、监测和限制。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
定海神针!孙颖莎3-1击败26岁日本美女 后者交手20连败:绝望倒地

定海神针!孙颖莎3-1击败26岁日本美女 后者交手20连败:绝望倒地

风过乡
2026-09-24 20:34:26
中美元首会谈在即,最新民调:更多美国人积极看待中国,超半数要合作不要遏制

中美元首会谈在即,最新民调:更多美国人积极看待中国,超半数要合作不要遏制

上观新闻
2026-09-24 17:44:21
特朗普:我很高兴欢迎你们来到美丽的白宫

特朗普:我很高兴欢迎你们来到美丽的白宫

澎湃新闻
2026-09-25 03:23:02
张本智和:日本是我的祖国!要击败中国队 为日本夺得亚运会金牌

张本智和:日本是我的祖国!要击败中国队 为日本夺得亚运会金牌

念洲
2026-08-10 09:19:59
张本智和对松岛辉空撂下8字承诺,日网暴动:热血漫画剧情!

张本智和对松岛辉空撂下8字承诺,日网暴动:热血漫画剧情!

体育妞世界
2026-09-25 08:44:34
银行为啥突然要多给你利息?不是发善心,是真怕你把钱都取走

银行为啥突然要多给你利息?不是发善心,是真怕你把钱都取走

白米饭怎么吃
2026-09-24 22:52:04
国乒男团2-3日本咋输的?邓亚萍点破:排阵太冒险,张本球技上涨

国乒男团2-3日本咋输的?邓亚萍点破:排阵太冒险,张本球技上涨

生活新鲜市
2026-09-25 08:09:39
茶叶立大功!医生研究发现,常喝茶的人或有六大好处

茶叶立大功!医生研究发现,常喝茶的人或有六大好处

椰青美食分享
2026-09-25 05:00:23
行业最低!荣耀Magic9价格公布:16+512G只要5499元 网友:荣耀掀桌子了

行业最低!荣耀Magic9价格公布:16+512G只要5499元 网友:荣耀掀桌子了

快科技
2026-09-24 16:50:13
北京西站那个走路带风的退伍女兵,到底啥来头?

北京西站那个走路带风的退伍女兵,到底啥来头?

健身狂人
2026-09-25 04:37:50
女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

看世界的人
2026-08-07 09:22:50
随着葡萄牙1-0,德国1-1,挪威3-2,欧国联最新积分榜出炉

随着葡萄牙1-0,德国1-1,挪威3-2,欧国联最新积分榜出炉

侧身凌空斩
2026-09-25 05:11:24
王朱悦回应《微微一笑很倾城》换脸:“确实是我本人授权换的脸,和大家道歉,毁了大家心中的角色!”

王朱悦回应《微微一笑很倾城》换脸:“确实是我本人授权换的脸,和大家道歉,毁了大家心中的角色!”

韩小娱
2026-09-24 17:39:35
最心痛的不是国乒丢冠,而是王楚钦的独木难支!樊振东才是解题密码

最心痛的不是国乒丢冠,而是王楚钦的独木难支!樊振东才是解题密码

十点街球体育
2026-09-25 07:35:04
杨虎城之女:假如不是张学良轻信蒋介石,我父亲不会被囚禁十二年

杨虎城之女:假如不是张学良轻信蒋介石,我父亲不会被囚禁十二年

磊子讲史
2026-02-04 11:21:41
奥运冠军张家齐疑似住串串房!生活质量明显下降,曝15年赚的钱都被妈妈拿走

奥运冠军张家齐疑似住串串房!生活质量明显下降,曝15年赚的钱都被妈妈拿走

韩小娱
2026-09-22 17:37:47
车位紧贴墙,车门打不开!南宁一业主花10万元买了个“糟心车位”,申请退换遭踢皮球

车位紧贴墙,车门打不开!南宁一业主花10万元买了个“糟心车位”,申请退换遭踢皮球

大风新闻
2026-09-24 21:49:12
教育部回应“13岁于子迪亚运泳池连夺两金”:我们觉得这是一件非常了不起的事情

教育部回应“13岁于子迪亚运泳池连夺两金”:我们觉得这是一件非常了不起的事情

极目新闻
2026-09-23 12:19:13
阿尔特塔再下狠手!阿森纳 6400 万水货遭弃!或成下一个马丁内利

阿尔特塔再下狠手!阿森纳 6400 万水货遭弃!或成下一个马丁内利

澜归序
2026-09-25 09:00:08
果然还是新脑子好使!网友:我等这个帖子等了800年!

果然还是新脑子好使!网友:我等这个帖子等了800年!

另子维爱读史
2026-09-16 20:05:39
2026-09-25 09:20:49
cnBeta.COM incentive-icons
cnBeta.COM
提供IT行业即时资讯
71553文章数 70319关注度
往期回顾 全部

科技要闻

DeepSeek涨价后客户没少 年化收入10亿美元

头条要闻

王皓回应国乒男团决赛的失利:年轻队员需要成长空间

头条要闻

王皓回应国乒男团决赛的失利:年轻队员需要成长空间

体育要闻

巴图姆,以父之名

娱乐要闻

93岁游本昌去世 最后一句话惹人泪目

财经要闻

月饼卖不动了...

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

健康
游戏
房产
时尚
公开课

鼻子三角区的痘,千万别乱挤!

CDPR称《巫师4》选择及后果将给玩家留下深刻印象

房产要闻

中秋、国庆小长假来了,但我劝你别离开海口

秋冬最舒适的“豹款”,这样穿才好看!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版