当AI代理替你填写网页表单时,隐藏在页面文字里的恶意指令突然劫持它的行为——这就是提示注入攻击。它曾是浏览器智能体的致命弱点。但如今,Anthropic给出的数据让人眼前一亮:Opus 5在129项测试中,提示注入成功率为0%。这一数字直接挑战了OpenAI在去年12月的判断——提示注入可能永远无法被彻底解决。
根据Anthropic系统卡披露的细节,这一成绩建立在自动模式启用之上。该模式叠加了两层防御:一层在模型处理数据前扫描输入的隐藏指令,另一层在执行动作前拦截危险操作。攻击者必须同时突破两套独立防线,任何单一漏洞都无法得手。而在关闭自动模式的情况下,Opus 5的提示注入成功率回升至3.7%。有意思的是,Sonnet 5在不依赖额外防御时表现更稳健,成功率只有0.93%,这暗示模型架构本身对注入攻击已具备一定的鲁棒性。安全公司Gray Swan的另一项通用提示注入测试中,经过15次尝试,成功率从Opus 4.8的5.5%下降到了Opus 5的2.0%。
![]()
相比之下,OpenAI至今未发布自家模型的可比安全基准。一方在详细公布系统卡数据,另一方却公开承认问题棘手。对正打算用AI代理处理敏感浏览器任务的企业客户来说,这一差异可能会成为决策的分水岭。Anthropic顺势将安全优势与已有的开发能力绑定——其终端编程代理Claude Code在SWE-bench已验证基准中取得了88.6%的得分,如今叠加提示注入免疫情,对企业客户的吸引力进一步加强。
然而,如果把0%视为绝对安全的通行证,还为时过早。Anthropic自己也坦然承认,129个测试场景并非穷尽,现实中攻击者可能利用测试未覆盖的边缘案例发动偷袭。系统卡没有披露受测攻击类型的多样性,也让人难以判断防御的广度。更关键的是,0%的稳定表现绑定在自动模式上,而该模式会引入额外延迟。安全性与响应速度之间的得失——原文中只用“仍未量化”一笔带过,但在实际部署中,延迟敏感的自动化场景能否忍受这层代价,同样需要实测数据来回答。
安全从来不是一个孤立的点,而是一张网。就在Opus 5展示注入免疫力的同时,Anthropic也面临其他维度的隐患:近期公开的CVE-2026-30623漏洞,指向MCP(模块化认知程序)中的标准输入输出命令注入风险。一个在浏览器代理层面几乎滴水不漏的模型,在别的接口上仍可能被突破,这提醒我们,纵深防御比单一指标更值得关注。
接下来的看点很明确:Gray Swan或Trail of Bits这类独立红队能否重现、甚至挑战Opus 5的零注入神话;OpenAI是否在下一代模型中拿出对标安全基准;以及Claude Cowork等产品在企业端的采用速度。对行业而言,0%是一个里程碑,但它能维持多久、能在多广的攻击面上复现,才是决定提示注入能否从“无解”变为“可防”的真正标尺。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.