3 万 Agent 上岗,多 Agent 开始比成本。
9 月 18 日,Claude Code 的架构换了一遍。
主对话框下一个高阶目标,协调器拆成多个子任务,派给并行工作线程。每个线程跑在云端独立环境里,各自拉一条 Git 分支,写完自动提交、生成 PR。
指令下完就能合上电脑走人。
同一天,Anthropic 披露《衡量 AI 研发节奏》。
内部研发平台每天同时跑着 3 万个 AI Agent,单月决策量超 10 亿次,AL4 级研发任务占比 26%。
今年 2 月,这个数字还不足 1%。
Anthropic 自己的公开表述里还有一句"多 Agent 肯定是不便宜的",并提醒注意 usage。
多 Agent 协作的竞争落点,已经从模型能力转到了编排成本上。
拆解、代码隔离、上下文对齐这三件事,以前是在人脑子里做的,现在被拆成了系统环节。
要解决的是多个写手同时开工怎么不互相踩,怎么共享同一套上下文。
这跟模型写得好不好是两件事。
26% 是任务口径,跟岗位数不是一回事,混着读会把进度看快一年。
另一头是成本。并行的分母里还有两笔账没被算清:Token 和合并冲突。
而在一周之内,Anthropic 和 Cursor 做了同方向的动作。
事实部分来自 Anthropic 9 月 18 日的《衡量 AI 研发节奏》报告与 Claude Code 架构更新说明,以及 Cursor 9 月 10 日的 Projects beta 公开信息。
没有可复现的实测数据,就不写实测口吻。
多 Agent 卡住的不是模型会不会写
此前主流的编码 Agent 是单 Agent 模式:一次处理一个任务。Cursor、Claude Code、Codex 都是这个形态。
新架构把三个环节从人脑里搬了出来。
数据来源:Anthropic 2026-09-18 公开信息
一个人一次只能盯住一个任务,这是注意力的上限。
把并行线程数提上去,先要解决多条线同时改同一个仓库的问题。
![]()
图 1 多 Agent 协作链路的五个环节
26% 是任务口径,不是岗位口径
AL4 级的定义是"AI 凭高阶指令端到端完成任务",26% 指这个级别的研发任务占比。
另一个数是 AL3 级(深度人机协作)流程占比,超 90%。
两者不是一回事。
90% 更接近多数团队眼下的真实状态:人牵头,AI 深度参与。
26% 讲的是另外那部分——人给一句高阶指令,剩下交给 AI。
报告还给了两项监控与安全口径的数字。
- 8 月的 10 亿次决策中,Agent Oversight 拦截约 0.002% 的高风险或异常行为
- 7 月 13 日至 20 日,约 6% 的 AI 研发算力用于安全与对齐研究
0.002% 是拦截比例。它说的是监控拦下了多少,不是总共发生了多少。
公开信息里没有给出后者。
![]()
图 2 AL3 与 AL4 的公开分级口径
![]()
图 3 AL4 级研发任务占比:2 月与 9 月
并行的分母里有两笔账还没算清
第一笔是 Token。
多 Agent 并行意味着多个线程同时调用模型。线程数是乘数,消耗跟着走。
公开表述只到"不便宜"这一层,具体贵多少没给数。
第二笔是合并冲突。
多条分支并行改同一片代码,协调器能理清依赖,但重叠修改该撞还是会撞。
最后还是需要人介入,判断哪一条留下。并行度越高,这块的边际成本越大。
判断口径可以这么设:多 Agent 比单 Agent 贵 5 倍、只快 2 倍的话,商业上就站不住。
真正缺的是这一格数。
报告给了决策量、拦截率、算力占比,唯独没给每个任务的平均成本和多 Agent 相比单 Agent 的效率差。
这两项没有披露,眼下关于投入产出的判断都还停在推算阶段。
一周之内两家做同一件事,竞争落点换了
9 月 10 日,Cursor 发布 Projects beta,主打 Coordinator Agent,向下派发数千个子 Agent。
8 天后,Claude Code 更新为原生多 Agent 架构。
编码 Agent 早先的卖点一直是模型能力:补全准不准、上下文多长、一次能改多少文件。
比较对象换了一层——比的不再是单次输出质量,而是多个线程同时跑时,编排做得怎么样。
![]()
图 4 两家在同一周内的公开动作并列
可比的维度有三个:编排的粒度、可控的程度、单位任务的花费。
前两项目前没有可比较的公开口径,第三项两家都没有公布数。
单个任务能做多好,取决于模型。同一时间能推进多少、每个要花多少,取决于编排。
评估重点也就从"模型行不行",挪到了"单位产出要多少成本"。
两个地方不成立。
一是口径。3 万 Agent、26% 出自 Anthropic 自家的内部研发平台,跑在自研仓库与自家工具链上。
换一支代码库更小、模块耦合更高的团队,并行的收益结构会不一样。
二是前置条件。多 Agent 的收益建立在单次任务成功率足够高之上。
单 Agent 基线本来就低的话,并行会把失败一起放大。
顺序是先跑顺单 Agent,再加线程。
两个指标值得盯:多 Agent 相比单 Agent 的实际效率差,以及单位任务成本能不能降下来。
本文事实信息来自 Anthropic《衡量 AI 研发节奏》报告与 Cursor 官方发布,截至 2026 年 9 月 18 日。观点部分为基于公开信息的分析,不构成对任何产品或企业的评价。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.