3万AI Agent同时上岗:Claude Code大重构
2026年9月18日 | AI Coding × 具身智能 行业日报
一、Claude Code大重构:原生多Agent+共享记忆,3万Agent同时上岗,26%研发由AI主导
![]()
事件内容:9月18日,Claude Code项目功能迎来全面重构,原生支持多Agent玩法。用户下达目标,Claude在云端派生多条Git分支并行干活,写完直接提PR。架构核心是一个名为Coordinator(协调器)的大脑——开发者在主对话框下达高阶目标,协调器自动拆解为多个子任务,调度分配给并行的工作线程。每个工作线程是运行在云端独立环境里的Claude Code实例,拥有完全隔离的代码副本,各自拉出独立Git分支,在后台同时推进不同模块的代码编写与单测,完成后自动提交代码并生成PR。新增共享记忆,所有分支线程沉淀的技术规范、架构决策与团队偏好实时同步回共享记忆,保证Agent之间上下文对齐。整个过程支持完全异步,开发者下完指令合上电脑就能走。
同一时间,Anthropic披露《衡量AI研发节奏》报告:内部研发平台每天同时跑着3万个AI Agent,单月触发决策量超10亿次。AL4级(AI凭高阶指令端到端完成任务)研发任务占比26%,而今年2月这个数字还不足1%——半年飙升26倍。超过90%的研发流程已处在AL3级别(深度人机协作)。8月份超10亿次模型决策中,Agent Oversight监控系统精准拦截约0.002%的高风险或异常行为。7月13日至20日,约6%的AI研发算力花在安全与对齐研究上。
关注价值:这是AI Coding从"单点提效"走向"团队级协作"的标志性事件。此前的编码Agent(Cursor、Claude Code、Codex)主要是单Agent模式——一个Agent一次处理一个任务。Claude Code的多Agent重构,把"一个人带一个Agent"变成了"一个人带一个Agent军团"。Coordinator协调器+独立Git分支+共享记忆的三件套,解决了多Agent协作的核心痛点:任务拆解、上下文对齐、代码隔离。3万Agent同时上岗、26%研发由AI主导,这组数据更有冲击力——它证明了多Agent协作不是概念,而是已经在Anthropic内部大规模跑通的生产模式。半年从1%到26%的增速,说明AI自主研发的能力正在以超线性速度提升。
个人深度思考:Claude Code的多Agent重构和Anthropic内部3万Agent的数据,共同指向一个趋势:写代码的动作正在迅速贬值,工程拆解与任务调度的能力成了核心。以前一个中级工程师一次只能死磕一个特性,现在一个人就是一个技术小组,底下带着一群Agent同时开工。人的角色从逐行敲代码的执行者,变成了拍板架构方向、审核PR和处理异常边界的技术负责人。但多Agent并行不是万能灵药——多分支重叠修改依然会撞上Git合并冲突,协调器能理清依赖关系,但最终还是需要人类工程师介入把关。成本也是一个现实问题:多Agent并行意味着Token消耗成倍增长,Anthropic自己也承认"多Agent肯定是不便宜的",建议用户随时注意usage。
另一个值得关注的点是Cursor的跟进——9月10日Cursor也发布了Projects beta,同样主打Coordinator Agent,向下派发数千个子Agent。这说明多Agent协作已经成为AI Coding的行业共识,不是某一家的独走。接下来看两个关键指标:一是多Agent模式的实际效率提升(相比单Agent,能快多少、质量如何),二是成本能不能降下来(如果多Agent比单Agent贵5倍但只快2倍,商业可行性就有问题)。AI Coding的竞争已经从"谁的模型更聪明"转向"谁的Agent编排更高效、更可控、更便宜"。
二、特斯拉Optimus量产加速:团队落地宁波,开启中国供应链审厂,2026年计划下线5万台
![]()
事件内容:据产业链人士消息,特斯拉相关团队已于9月16日落地宁波,并于9月17日开启新一轮针对旗下机器人业务的量产审厂。此轮审厂目标是配合审查Optimus机器人量产独家性和一致性,包括帮助企业进行设备调试,将美国工厂的制造能力进行迁移等。特斯拉此轮审厂将实质导向Optimus的量产,目前已经向供应链企业下达相关订单。按计划,特斯拉将在2026年下线5万台左右Optimus机器人,并部署至旗下世界各地的特斯拉超级工厂。
关注价值:特斯拉Optimus的量产进度一直是人形机器人行业的风向标。马斯克多次表示Optimus的长期需求会达到100亿台,但量产时间表多次推迟。此次中国供应链审厂,说明Optimus的量产已经从"美国工厂试点"进入"全球供应链准备"阶段。宁波是中国制造业重镇,拥有完整的精密加工、电机、减速器供应链,特斯拉选择在这里审厂,意味着Optimus的核心零部件将大量依赖中国供应链。2026年下线5万台的目标,如果能实现,将是人形机器人行业最大规模的量产交付——目前全行业的年出货量才2万多台,特斯拉一家就要干5万台。
个人深度思考:特斯拉Optimus的量产节奏,直接决定了整个人形机器人行业的估值逻辑。如果2026年真能下线5万台并部署到超级工厂,说明人形机器人的"工厂场景"已经跑通,行业会从"概念期"进入"放量期"。但5万台的目标也有风险:Optimus的技术成熟度、供应链稳定性、工厂实际作业能力,任何一个环节出问题都可能导致量产延期。马斯克的时间表历来偏乐观,Model 3的"产能地狱"记忆犹新,Optimus可能也会经历类似过程。
中国供应链审厂是一个重要信号:特斯拉正在把Optimus的制造能力从美国迁移到中国,这和特斯拉汽车的供应链策略一致——利用中国的制造能力和成本优势。对中国供应链企业来说,进入特斯拉Optimus的供应链意味着巨大的订单机会,但也意味着要满足特斯拉极其严苛的质量和成本要求。接下来看三个指标:一是审厂结果(哪些中国企业进入了Optimus供应链),二是Optimus的实际下线数量(5万台目标能不能完成),三是Optimus在超级工厂的实际作业时长和稳定性(能不能连续三班倒运行)。特斯拉如果跑通了,整个人形机器人行业都会加速;如果跑不通,行业估值会面临回调。
三、OpenAI Sam Altman首次明确:一定会做人形机器人,重点做"大脑"
![]()
事件内容:GPT-6 Astra发布之后,OpenAI CEO Sam Altman在Sources播客访谈中首次明确宣布布局人形机器人,重点关注驱动机器人运转的"大脑"能力。Astra在操控机器人方面表现出明显的能力分层:抓起物体、移动位置这类粗操作20次能成功,但需要精确接触的最后一步(如拼图零件嵌入对应凹槽)20次却只成功2次。从抓起物体、移动位置,到需要精确接触的最后一步,表现拉开了距离。Altman的表态意味着OpenAI正式从"纯软件AI公司"向"软件+硬件"扩展,人形机器人成为其下一个战略方向。
关注价值:OpenAI做人形机器人,和特斯拉、Figure、宇树等公司的路径完全不同。OpenAI不做本体(硬件),重点做"大脑"(AI模型和控制算法)。这是一个很清晰的定位:OpenAI的核心优势是大模型能力,把这个能力嫁接到机器人上,做机器人的"操作系统"或"大脑"。Astra的机器人操控测试也很有价值——它揭示了当前AI模型在机器人操控上的能力边界:粗操作(抓起、移动)已经不错,但精细操作(嵌入、插拔、对准)还很差。这个"最后1厘米"的难题,正是人形机器人从"能搬东西"到"能干活"的关键瓶颈。
个人深度思考:OpenAI入局人形机器人,是今年最重要的行业信号之一。当全球最强的大模型公司开始认真做机器人"大脑",意味着具身智能的"大脑竞争"正式升级。此前机器人公司的"大脑"主要靠自己训练(如Figure的自研模型、智元的远征系列模型),OpenAI的入局会带来一个选择:机器人公司是继续自研大脑,还是接入OpenAI的通用大脑?这和智能手机时代很像——早期手机厂商都自己做操作系统,后来大部分都用了Android。如果OpenAI的机器人大脑足够强,很多机器人公司可能会选择接入,而不是自研。
但OpenAI做机器人大脑也有挑战:机器人操控需要的不只是语言理解,还需要物理世界的交互能力——力反馈、触觉、视觉-运动协调,这些是纯大模型不擅长的。Astra的测试结果(精细操作20次成功2次)说明,通用大模型直接操控机器人还有很长的路要走。接下来看OpenAI会不会收购或投资机器人本体公司(类似Meta收购Assured Robot Intelligence),以及会不会开源机器人大脑模型。如果OpenAI的大脑能力能在一年内把精细操作成功率从10%提升到50%以上,整个人形机器人行业都会被加速。
四、Google开源Mantis:AI编码Agent安全审查工具包,覆盖完整漏洞生命周期
![]()
事件内容:Google开源Mantis,一个stack-agnostic(技术栈无关)的AI编码Agent安全审查工具包。Mantis运行完整的漏洞生命周期:扫描代码库(sweep)、识别潜在漏洞候选、验证候选是否真实存在、结构化输出审查结果。它不是一个单一的安全扫描器,而是一套可编排的安全审查技能集合,可以嵌入到任何AI编码Agent的工作流中。Mantis的设计目标是让AI编码Agent的安全审查从"猜测式找漏洞"变成"可复核、可追溯、可验证的工程流程"。
关注价值:AI编码Agent的安全审查是一个被严重低估的痛点。随着AI生成代码的比例越来越高(JetBrains报告显示90%开发者每周用AI编程Agent),AI引入的安全漏洞也在快速增加。但传统的安全审查方式(人工Code Review、静态扫描工具)很难应对AI生成代码的规模和速度。Mantis的价值在于:它把安全审查变成了AI Agent可以自主执行的一套流程——不是让Agent"找漏洞"(这容易产生大量误报),而是让Agent按照标准化的流程去扫描、验证、输出,每一步都有证据支撑。stack-agnostic的设计也很重要——它不绑定特定的编程语言或框架,可以用在任何技术栈的项目中。
个人深度思考:Google开源Mantis,和Cloudflare开源Security Audit Skill(六阶段安全审计流程),形成了一个趋势:AI编码Agent的安全审查正在从"ad hoc"走向"工程化"。当AI生成的代码占比越来越高,安全审查不能再靠人工逐条看——必须让AI自己来审,但AI审查必须有标准化的流程和可验证的证据,否则就是"用AI审AI,谁也不信谁"。Mantis的完整漏洞生命周期设计(扫描→验证→输出)是关键——它避免了AI安全审查最常见的问题:把猜测写成结论。每一个发现的漏洞都必须经过验证步骤,确认真实存在才会输出。
对企业来说,Mantis这类工具的价值很直接:可以嵌入到CI/CD流水线中,每次AI生成代码后自动运行安全审查,不需要人工介入。但也要注意:Mantis是工具包,不是开箱即用的产品——需要企业自己集成到现有的AI编码工作流中。接下来看GitHub Copilot、Cursor、Claude Code等主流AI编码工具会不会内置类似的安全审查能力,以及Mantis的实际漏洞检出率和误报率如何。AI编码的安全问题会越来越受重视,谁能提供可信、高效的AI安全审查方案,谁就能在企业级市场占据优势。
五、Agility Robotics Digit扩展到50个商业地点:最后一英里配送和包裹分拣
![]()
事件内容:9月18日,Agility Robotics确认Digit商业舰队部署计划,将Digit扩展到50个商业地点,用于最后一英里配送和包裹分拣。同时宣布基础设施支持和维护模式,为商业客户提供部署后的运维保障。Digit是Agility Robotics开发的双足人形机器人,专注于物流和配送场景,此前已在亚马逊等客户的仓库中进行试点。此次扩展到50个商业地点,标志着Digit从"试点项目"进入"规模化商业部署"阶段。
关注价值:Digit代表了人形机器人的另一条商业化路径——不追求全尺寸通用人形,而是专注于物流配送这一个场景。Digit的设计(双足、无手臂或简化手臂、专注搬运)就是为物流场景优化的。扩展到50个商业地点,说明Digit的商业模型已经跑通——客户愿意付费,机器人能稳定工作,运维模式可持续。最后一英里配送和包裹分拣是物流行业最大的人力成本痛点之一,也是最容易标准化的场景——包裹的形状、重量、搬运路径都相对固定,机器人容易适应。和全尺寸人形机器人相比,Digit的商业化路径更清晰、更务实。
个人深度思考:Agility Robotics的Digit和智元的远征A3 Ultra,代表了人形机器人商业化的两种路线:Digit是"专用场景优先"——先在物流配送一个场景做深做透,再考虑扩展;远征A3 Ultra是"多场景并行"——同时进入4S店、酒店、便利店,验证通用能力。两种路线各有优劣:专用路线更容易跑通商业闭环,但天花板有限;通用路线天花板高,但商业化难度大。Digit扩展到50个商业地点,说明专用路线已经进入规模化阶段,而全尺寸通用人形还在"案例视频"阶段。
对行业来说,Digit的成功有一个重要启示:人形机器人不一定需要"人形"——Digit的外形更像"一只会走路的箱子",但它能干活、能赚钱。过度追求人形外观可能会增加成本和复杂度,而商业客户关心的是"能不能替代人工、能不能降低成本"。接下来看Digit的50个地点能不能稳定运营(故障率、维护成本、客户续约率),以及Agility Robotics能不能把单台机器人的成本降到客户能接受的范围。如果Digit能在物流场景实现盈利,会给整个人形机器人行业提供一个可复制的商业模板。
六、Grab LLM-Kit:500+内部Agent标准化,部署从2周缩到1小时
![]()
事件内容:Grab(东南亚出行与外卖巨头)实现了LLM-Kit,一个标准化超过500个内部Agent服务的框架。该系统增强了服务集成、评估和密钥处理,将新AI Agent的部署时间从两周缩短到一小时。LLM-Kit集中化基础设施管理,支持运行时工具发现和灵活的模型集成,同时保持运营控制。Grab有500+内部Agent在跑,覆盖出行、外卖、支付、物流等多个业务线,LLM-Kit是这些Agent的统一运行和管理层。
关注价值:Grab的LLM-Kit是企业级AI Agent基础设施的一个典型案例。当企业内部的Agent数量从几个增长到几百个,就会面临"Agent治理"的问题:每个Agent用什么模型、调用什么工具、怎么管理密钥、怎么评估效果、怎么控制成本。没有统一的框架,500个Agent就是500个独立的"烟囱",维护成本极高,安全风险也大。LLM-Kit解决的就是这个问题:统一模型集成、统一工具发现、统一密钥管理、统一评估体系,让新Agent的部署从两周缩到一小时。这个案例说明,企业级AI Agent的竞争已经从"能不能做Agent"转向"能不能规模化管理Agent"。
个人深度思考:Grab的LLM-Kit代表了AI Agent企业落地的"第二阶段"。第一阶段是"试点"——每个团队自己做几个Agent,验证价值;第二阶段是"规模化"——Agent数量爆炸,需要统一的基础设施和治理框架。很多企业现在还在第一阶段,但很快就会进入第二阶段,到时候"Agent治理"会成为CIO的核心议题。LLM-Kit的设计思路(集中化基础设施+运行时工具发现+灵活模型集成+运营控制)值得所有企业参考。
对AI Agent厂商来说,这也是一个信号:企业客户需要的不只是Agent产品,还需要Agent管理平台。谁能提供"Agent+治理"的一体化方案,谁就能在企业级市场胜出。接下来看其他大型互联网公司(阿里、腾讯、字节、美团)会不会公开类似的内部Agent基础设施,以及会不会有第三方厂商推出商业化的Agent治理平台。Grab的500+Agent和1小时部署时间,说明企业级Agent的规模化已经不是概念,而是正在发生的现实。
七、松延动力HERON-CRA情境强化行动模型发布,本体业务明年有望盈利
![]()
事件内容:9月15日,松延动力发布HERON-Context Reinforcement Action Model(CRA,情境强化行动模型)。这是继9月8日发布HERON架构下首个世界模型HERON-World Model后,该公司推出的第二个模型。8日当天,松延动力还推出了通用具身智能子品牌Scalabot,明确将专注于构建面向真实世界的具身"大脑"。松延动力同时划定四条红线,聚焦具身智能的核心能力建设。在本体业务方面,松延动力表示若本体业务单独核算,明年有望盈利。
关注价值:松延动力是国内人形机器人领域的重要玩家,此前以本体(硬件)见长。此次密集发布模型(9月8日世界模型、9月15日行动模型)和子品牌Scalabot,说明松延动力正在从"本体公司"向"本体+大脑"的全栈公司转型。HERON-CRA情境强化行动模型的核心是"情境强化"——机器人能根据当前情境(环境状态、任务目标、历史经验)动态调整行动策略,而不是执行预设动作。这和传统的强化学习不同,它强调"情境感知",让机器人在复杂多变的真实环境中更灵活地行动。本体业务明年有望盈利,也是一个积极信号——说明松延动力的本体销售已经接近盈亏平衡点。
个人深度思考:松延动力的转型路径很有代表性:从做本体(硬件)起家,发现"没有大脑的本体只是个壳",于是开始自研具身智能模型。这和很多机器人公司的路径一致——早期拼硬件,后期拼算法。但自研"大脑"的门槛很高:需要大量数据、强大的算力、顶尖的算法团队,不是每家公司都能做。松延动力选择"世界模型+行动模型"的双模型架构,是当前具身智能的主流技术路线——世界模型负责理解和预测环境,行动模型负责决策和执行。
"本体业务明年有望盈利"这个信号值得关注。如果松延动力的本体业务能盈利,说明人形机器人的硬件销售已经能覆盖研发和生产成本,这是行业从"烧钱"走向"造血"的关键一步。但也要注意:本体盈利不代表公司整体盈利,大脑研发的投入可能还很大。接下来看松延动力的HERON模型能不能在真实场景中验证效果(而不只是论文和Demo),以及Scalabot子品牌能不能吸引到合作伙伴。具身智能的"大脑"竞争正在加剧——智元、松延、Figure、OpenAI、Meta都在做,最终谁的大脑能成为行业标准,还需要时间验证。
本期完。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.