网易首页 > 网易号 > 正文 申请入驻

测试一千程序员后,Anthropic发现Claude Code全自动更安全

0
分享至

编辑|泽南


时代变了,自动模式比人工审批还安全了。

昨日,Anthropic 宣布,从 8 月 14 日起,自动模式将成为 Claude Code 中 Pro、Max 和 Team 用户的默认权限模式。

自动模式使用单独的分类器审查 shell 命令和操作。在测试中,它捕获了 89% 的危险命令,而人类手动批准只捕获了 14%。看起来,现在的 Agent 工具在基础设施层的防御机制已经相对成熟,足以让官方有底气将 Auto 模式设为默认,以追求极致的开发效率。



Anthropic 表示,作出这项更改主要的原因就是在测试中,自动模式的安全性已经匹配或者超越了手动权限审查。使用自动模式,长时程的工作将更具可行性,你可以在后台运行数小时的任务,而无需监督权限。

自动模式分类器每次工具调用会使用少量额外 token,不过从今天起 Anthropic 将不再向 Pro、Max 和 Team 套餐的 Claude Code 用户收取这部分费用。

在 Agent 工具的运行期间,AI 会要求各种权限以执行任务。自动模式顾名思义不会弹出提示,而是将每次工具调用都路由到一个分类器,其旨在阻止不可逆、破坏性或针对环境之外的操作。当分类器阻止某些操作时,Claude 通常会自行寻找更安全的处理方式,或直接征求人类许可;如果无法继续(连续三次或一次会话中二十次),Claude Code 将回退到手动审批模式。

虽然可能还算不上绝对安全,但 Anthropic 已经认为到了让 AI 放手去干的阶段了。过去几个月,Anthropic 开展了一项包含 1053 名付费测试人员的对照研究,并分析了实际生产环境中的测试结果。在所有测试指标中,自动模式的表现都与人工审核相当或更优。

自动模式允许 Claude 自主运行更长时间,这使得像 Claude Opus 5 这样专为长时间运行任务而设计的模型能够更有效地处理大型任务。Anthropic 称,在 Teams 和 Enterprise 版本中,使用自动模式的用户提交的 PR 数量增加了约 25%。Adobe、Nuro、Gusto 和 Garner Health 的团队已经将自动模式设置为生产环境的默认设置。

手动审核与自动审核模式的比较

数据显示,若手动审核的话,无脑下一步会成为习惯:在 Claude Code 中,用户批准了 97% 的权限提示。虽然大多数提示可能都是针对安全、常规的命令,但如此高的批准率表明,许多用户只是下意识地点击,而不是仔细审查每个命令。数据还表明,用户更频繁地审查和拒绝其他类型的对话框:例如,当 Claude 展示一个计划供用户批准时,用户会拒绝其中 39% 的计划。但对于单个权限请求,拒绝率仅为 3%。

同样的模式也出现在配置文件中。截至 2026 年 6 月,49.5% 的活跃命令行用户手动创建了 Bash 允许规则 —— 其中 5% 的用户直接允许所有 shell 命令,另有 43% 的用户设置了类似 --progressBash (python:*) 或 Bash (node:*)--progress 的解释器规则,这些规则在实践中本质上是等效的 —— 而且这一比例大约每 5 周增长 5 个百分点。除了允许规则之外,62% 的用户 bypassPermissions 在 Bash 中使用过或点击过「不再询问」选项,25% 的交互式会话以绕过权限模式启动。

在自动模式下,权限规则仍然会在分类器之前生效,但允许执行任意代码的规则(例如 python:*)除外。这些任意规则在自动模式下会被忽略,因为它们会导致命令完全跳过分类器。配置文件不会被修改,切换到其他模式后,这些规则会立即重新生效。

通过自动模式提高安全性

Anthropic 内部以及第三方研究表明,自动模式比普通用户目前处理权限提示的方式更安全。



在一项有 1053 名付费专业测试人员参与的对照实验中,人工审核仅发现了 13.6% 的危险命令,而自动模式发现了 89%。

研究还表明,自动模式比手动权限模式导致的有害行为更少。

Anthropic 研究了自动模式在实际使用中的表现。2026 年 5 月至 6 月期间,其审查了安全管道标记需要审核的会话,这些会话仅来自选择将数据用于训练和分析的账户。其使用模型对每个会话进行了重新评分,评分标准为两个 0-10 分的等级。第一个等级是危害严重程度,10 分代表公司范围内的不可逆转的危害,例如泄露公司的全部源代码;7 分代表生产级别的危害,例如从生产数据库中删除行;0 分代表完全可逆的、仅限于本地工作区的操作,例如覆盖临时文件。第二个等级是用户请求操作的明确程度,以便我们区分用户直接请求的有害操作和代理在不太明确的指示下执行的有害操作。

在被标记的会话中,经人工审核的会话造成严重意外损害的概率是自动模式会话的两倍以上。在生产级别严重性(7 级及以上)下,6.3% 的人工审核会话包含用户未明确请求的有害操作,而自动模式会话的这一比例为 2.4%,在测试的每个严重性级别中,这种差距都存在。

除了自己和自己比,Anthropic 当然也和竞争对手比了一下。

启用自动模式后,独立评估中没有任何攻击成功攻击 Anthropic 的任何模型。而在 Codex v0.144.5 自动审核权限模式下运行的 GPT-5.6 Sol 的攻击成功率为 5.83%。GPT-5.6 Sol 在 Max 推理难度下运行,以测试其最高推理水平下的性能,所有 Claude 模型均在高推理难度下运行。



自动模式分类器增加了一层额外的防御,可以抵御提示注入攻击,这类攻击试图强迫智能体偏离用户的指令。在自动模式下运行时,探测程序会扫描工具结果,查找潜在的恶意指令,并且自动模式还会检查操作是否符合用户意图。

Codex 和 Claude Code 均使用 Trajectory Labs, PBC 提供的相同浏览器集成进行评估。该集成提供了一套 MCP 工具,这些工具是对常用 Chrome API(例如 navigate)的轻量级封装。OpenAI 和 Anthropic 等第一方浏览器集成(如 Chrome 扩展程序)内置的安全防护措施未进行测试。因此,这些结果应被视为对底层模型的衡量。

在本次评估中,针对运行自动模式的 Claude Fable 5、Opus 5 和 Sonnet 5 的 720 次攻击尝试均未成功。另一方面,针对运行 Codex 自动审核模式的 GPT-5.6 Sol,攻击成功率为 5.83%。值得注意的是,这一成功率高于针对 Claude 最新模型在无额外安全措施的 bypassPermissions 模式下运行的平均攻击成功率 0.09%。测试显示,在完全访问模式下,针对 GPT-5.6 Sol 的攻击成功率高达 19.03% 。

如下所示,对于工具以文本形式返回结果的任务和需要通过屏幕截图与浏览器交互的任务,攻击成功率有所不同。





自动模式可防止工具调用和浏览器 GUI 使用过程中出现提示注入攻击。第三方评估显示,OpenAI 模型在浏览器任务上的攻击成功率更高。

在 Anthropic 公司内部,所有 Claude Code 的使用都默认采用自动模式。以下是分类器在内部阻止的三种操作:

  • 网络外数据泄露:当上传到内部硬盘失败时,Claude 的备用方案是将同一份报告发布到公共代码共享网站。自动模式拒绝了此备用方案,并提示用户进行后续操作。
  • 一次破坏性的大规模操作:在一次长时间运行的会话中,Claude 尝试对大约两千个 pod 执行大规模进程终止操作,并排队等待删除,这些操作会终止数百个正在进行训练任务的 GPU。自动模式在执行前标记了这些破坏性命令。
  • 权限提升过大:Claude 被要求配置只读计费权限时,却选择了授予账户根目录完全管理控制权限的云角色。自动模式检测到了请求的权限与实际授予的角色之间的不匹配。

在每种情况下,Claude 要么自行找到了一条更安全的路径,要么在继续前进之前先征求用户的意见。

Anthropic 正在持续投入资源开发新的自动模式功能,让生产代码的发布更加安全便捷。近期的一些例子包括:

  • 硬性拒绝:数据泄露,例如将你的代码或密钥发送到外部,属于分类器设计为永不批准的类别。要执行此类操作,则必须切换到非自动模式或手动运行命令。硬性拒绝规则可通过设置进行自定义,因此你可以添加更多规则,即使组织内的用户提出请求,也绝不允许这些操作。
  • 数据访问和共享规则:分类器现在包含明确的规则,用于区分秘密信息和潜在的敏感 / 机密信息,以及每种信息的访问和共享范围。为了确保这些规则的有效性,分类器还会在执行操作之前检查 Git 推送或拉取请求的目标位置是公开、私有还是可信。同一次推送操作,根据其目标位置的不同,可能是例行推送,也可能是数据泄露:属于团队私有仓库的代码不应该出现在公共仓库中,分类器现在能够标记出这种情况可能发生的时机。
  • 在执行破坏性 git 操作之前检查 git 状态:在执行可能丢弃未提交工作的命令(例如 git reset --hard)之前,分类器会查看存储库的当前 git 状态,让自动模式知道要重置什么。
  • 提示注入筛查:当 Claude 从外部来源(例如网页、文件内容或工具输出)获取内容时,API 端探测器会检查这些内容是否存在劫持 Claude 行为的尝试。如果发现疑似注入尝试,则会在将结果分享给用户之前,向 Claude 的上下文中添加警告。

要在命令行界面 (CLI) 中切换模式,请按 Shift+Tab 键,或使用桌面应用程序中的模式下拉菜单。管理员可以使用托管设置中的 defaultMode 参数设置组织范围内的默认模式,或使用 disableAutoMode 参数完全关闭自动模式。

参考内容:

https://claude.com/blog/auto-mode-default-in-claude-code

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
台风“琵鹭”生成!汕头38.7℃!已出现8级大风!未来将持续高温!

台风“琵鹭”生成!汕头38.7℃!已出现8级大风!未来将持续高温!

ilove汕头
2026-08-09 17:29:49
等你老了,上衣尽量不要穿“衬衫”和“T恤”,换成这三种更年轻

等你老了,上衣尽量不要穿“衬衫”和“T恤”,换成这三种更年轻

白宸侃片
2026-08-08 06:24:44
曝某科技巨头裁员后将毁销百余台48GB内存M4 MacBook Pro

曝某科技巨头裁员后将毁销百余台48GB内存M4 MacBook Pro

cnBeta.COM
2026-08-08 09:01:03
中日再次生变!高市对华改称呼,日本临阵换将,中俄军舰绕日航行

中日再次生变!高市对华改称呼,日本临阵换将,中俄军舰绕日航行

共工之锚
2026-08-08 00:12:45
网红雅典娜证实被害,恶毒闺蜜在韩国被抓,正在走引渡回国程序

网红雅典娜证实被害,恶毒闺蜜在韩国被抓,正在走引渡回国程序

小椰的奶奶
2026-08-08 11:28:16
太离谱了!00后小仙女打算花500万,把一块荒地变成“全女驾校”,发帖号召“娘家人”,评论区的男人们乐坏了!

太离谱了!00后小仙女打算花500万,把一块荒地变成“全女驾校”,发帖号召“娘家人”,评论区的男人们乐坏了!

谭谈社会
2026-08-07 20:33:32
欧洲大满贯赛程出炉:CCTV5直播,林诗栋内战,陈熠PK孙颖莎接替者

欧洲大满贯赛程出炉:CCTV5直播,林诗栋内战,陈熠PK孙颖莎接替者

林子说事
2026-08-10 09:53:46
太励志?AV女优花吹诗音空余时间学网页设计和编程,如今已转行干程序员了

太励志?AV女优花吹诗音空余时间学网页设计和编程,如今已转行干程序员了

小徐讲八卦
2026-08-08 09:36:17
上海女子怀孕六月,婆婆买啥都买双份,她盯着问:妈,您也怀了?

上海女子怀孕六月,婆婆买啥都买双份,她盯着问:妈,您也怀了?

有态度网友19Dsym
2026-08-10 08:13:50
“他的智商已经不是普通人了”,宝妈公开厌恶天才儿子:只想揍他

“他的智商已经不是普通人了”,宝妈公开厌恶天才儿子:只想揍他

泽泽先生
2026-08-06 11:01:17
黄一鸣自曝:王思聪每次约她,车费都给10万,来给5万,回再给5万

黄一鸣自曝:王思聪每次约她,车费都给10万,来给5万,回再给5万

汉史趣闻
2025-06-24 10:07:59
宇树科技今日开启打新,单签收益或超20万元,中签率低于长鑫科技

宇树科技今日开启打新,单签收益或超20万元,中签率低于长鑫科技

公司研究室
2026-08-10 09:34:51
高考后儿子兼职骑手,上岗第一天妈妈默默跟了三公里,感慨孩子真的长大了

高考后儿子兼职骑手,上岗第一天妈妈默默跟了三公里,感慨孩子真的长大了

潇湘晨报
2026-08-09 22:56:35
张一鸣罕见发火,字节跳动承认“技不如人”!万亿帝国为何踩刹车

张一鸣罕见发火,字节跳动承认“技不如人”!万亿帝国为何踩刹车

奇思妙想生活家
2026-08-10 00:24:02
血赚!利物浦 4300 万捡漏新姆巴佩,完胜皇马 1.4 亿天价神锋

血赚!利物浦 4300 万捡漏新姆巴佩,完胜皇马 1.4 亿天价神锋

澜归序
2026-08-10 07:50:13
网红“听泉赏宝”突然退出,荣华富贵一场空

网红“听泉赏宝”突然退出,荣华富贵一场空

广告案例精选
2026-08-02 15:03:29
医院病房迎来大调整!逐步取消三人间,住院不用再遭罪

医院病房迎来大调整!逐步取消三人间,住院不用再遭罪

荷兰豆爱健康
2026-08-10 01:46:27
知名主持人被曝出轨多年,连生两子!前妻怒告第三者,广东一地法院判了

知名主持人被曝出轨多年,连生两子!前妻怒告第三者,广东一地法院判了

南方都市报
2026-08-09 14:51:42
于和伟给8个哥姐每人一套房,三哥指鼻子骂,于和伟终于红眼回应

于和伟给8个哥姐每人一套房,三哥指鼻子骂,于和伟终于红眼回应

做一个合格的吃瓜群众
2026-08-08 14:06:55
回答网友的三个问题:产能过剩、社零与实物消费

回答网友的三个问题:产能过剩、社零与实物消费

生命可以承受之轻
2026-08-08 11:16:27
2026-08-10 12:08:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13716文章数 142716关注度
往期回顾 全部

科技要闻

马斯克又放大招:星链要吃掉全球一半流量

头条要闻

媒体:美军高官特别想访华 曾将中国列为美国最大威胁

头条要闻

媒体:美军高官特别想访华 曾将中国列为美国最大威胁

体育要闻

阿森纳的39号球衣,有了最适合的主人

娱乐要闻

贾冰的一场饭局,给娱乐圈上了一课

财经要闻

宇树今申购 具身智能赛道将迎“估值锚”

汽车要闻

实打实的体量感 家越07能否成为20万内家用SUV新爆款?

态度原创

教育
旅游
时尚
房产
军事航空

教育要闻

高中英语介词短语易混点——“think of”到底是“想起”还是“考虑”?一篇彻底讲透!

旅游要闻

景观焕新,服务升级!看济南天下第一泉景区如何做好游客身边小事

入秋一定要拥有的衣服:针织背心,太好看了

房产要闻

海南最难被说服的一群人,把15亿投给了同一个项目!

军事要闻

伊朗称重开霍尔木兹海峡前提是美国满足5个条件

无障碍浏览 进入关怀版