刚刚,Anthropic研究院发布文章称,AI已大幅加速自身研发,“递归自优化”或提前到来。
截至2026年5月,公司超80%入库代码由Claude编写;2026年二季度工程师日均合入代码是2024年的8倍。员工调研显示,依托Mythos Preview,研发产出中位数提升约4倍。
“2025年末Claude代码质量略逊人工,当前二者水准持平,我们预计今年之内AI代码质量将实现反超。”
由此,论文推演了发展停滞、人类控方向但研发全自动化、AI实现递归自优化自主迭代新模型三种可能的未来。
作者最担忧第三种,对齐风险不确定性极高。
对此,论文提出,可建立跨国核验机制,在头部企业同步履约前提下,阶段性暂停前沿AI研发,给社会治理与安全研究留出适配时间。
![]()
以下为论文全文——
在人工智能大半发展历程中,人类主导研发全流程的每一个环节。但在Anthropic,我们正把越来越多的AI研发工作交由AI系统自身完成,这大幅提速了我们的项目进度。
顺着这个趋势持续发展、再配上充足算力,最终会诞生一类能够独立自主设计、迭代下一代自身模型的AI,该现象被称作递归自优化。
我们目前尚未抵达这一阶段,递归自优化也并非必然会出现,但它到来的速度或许会超出绝大多数机构的筹备预期。
依托通用行业基准测试与Anthropic内部此前未对外披露的数据,The Anthropic Institute证实:AI已经在反向加速AI模型的迭代研发。
仅举一例:如今Anthropic工程师单季度交付的代码总量,达到2021至2025年平均水平的8倍。
本文提及的各项技术趋势预示,未来数年AI系统的能力还将迎来跨越式提升,其影响意义深远。能够自主迭代的AI会成为科技史上的里程碑突破,有望在科研、医疗等诸多领域为全人类创造巨大福祉;但完全实现递归自优化,也会抬升人类失去AI管控权的潜在风险。
一旦AI可以独立研发后继模型,针对AI的安全防护、运行监控、行为约束体系的重要性都会空前凸显。
![]()
2021–2023:初代Claude研发阶段
创立初期的Anthropic和普通科技企业并无两样:研发人员依靠笔记本编写代码、撰写文档。
2023–2025:对话机器人落地应用
研发人员借助早期CHATBOT协助部分研发工序,比如生成简短代码片段,再将生成内容复制粘贴至代码编辑器。
2025–2026:智能编码AGENT成型
随着AGENT能力迭代,它们可独立完成代码撰写与修改,部分场景下能完整编辑单个工程文件。
现阶段:自主型AGENT
如今的AGENT能够自主运行代码,还可将耗时数小时的工作任务委派给其他AGENT协同处理。
未来某一年?:研发闭环成型
未来AGENT或将具备从零搭建、训练全新模型的能力。倘若成真,后续版本的Claude能够依靠Claude自身持续迭代优化。
来自行业外部的数据佐证
AI模型性能迭代速度正在不断加快:模型可稳定独立完成的任务时长,从原先每7个月翻倍一次,缩短至约每4个月就实现翻倍。
2024年3月,Claude Opus 3可完成人类耗时4分钟的软件工程任务;时隔一年,Claude Sonnet 3.7能搞定耗时一个半小时的工作;再过一年,Claude Opus 4.6可承接需要12小时才能做完的项目。
若该增长曲线延续,今年AI就有望胜任熟练工程师需要数天才能落地的任务;2027年,AI或将攻克人类需要数周攻坚的工作。
编码、科研类基准测试也呈现同款增长规律:基准用于衡量模型在特定领域的性能表现,当模型得分趋近满分时即判定测试饱和。
SWE-bench是业界通用的真实软件工程测评:测评会给到模型一份开源工程源码与真实故障工单,要求模型编写修复代码并通过项目原生校验。
短短两年时间里,相关模型得分从个位数低位一路走高直至测试饱和。
CORE-Bench用来考核模型复现已有科研成果的能力,这也是AI开展原创研究的前置条件:测评向AI提供已发表论文配套代码与实验数据,要求复现全流程并还原论文实验结论。
2024年AI复现成功率仅20%,十五个月后该基准已被模型做到满分饱和。运营长周期任务测评的METR机构披露,Claude Mythos Preview可稳定不间断工作至少16小时,性能已经触及当前METR现有测试题库的性能上限。
通用基准测试能够直观反映AI能力上限,却无法量化AI反向加速自身研发的实际效果,想要探明这一点,就需要Anthropic这类AI企业的内部实测数据。
Anthropic内部实测数据
前沿大模型研发主要分为两大板块:一是工程落地,包含代码编写、基建部署、模型训练管控;二是科研探索,即敲定实验方向、解析实验结果、规划后续研究思路。
无论是工程还是科研领域,实测结论高度一致:工程侧,研发人员只需明确最终目标,Claude就能接手模糊需求、自主敲定落地路径;科研侧,面对参数完备的既定实验,Claude的执行水准已经比肩甚至超越资深研发人员。但在工程与科研的方向决策、主观研判环节,Claude和人类顶尖从业者仍存在显著差距,这也是当前AI距离自主研发下一代模型的核心短板。
Anthropic员工的工作任务会随资历晋升不断升级:新人只负责落地别人定好的需求,例如“导出按钮异常,请修复”;积累经验后仅接收目标指令、自主设计实施方案,例如“排查高负载下网络卡顿诱因”;资深专家则自主筛选研发课题,例如“团队下个季度的核心研发方向是什么”。依托企业内部数据,我们可以量化Claude在三类任务上的能力成长。
Claude现已承担Anthropic绝大部分代码编写工作:截至2026年5月,企业代码库中80%以上的合入代码由Claude产出。2025年2月Claude Code开启研究预览版之前,这一占比仅为低位个位数。
研发人员的产出数据同样印证变化:2021至2024四年间,工程师日均合入代码行数基本持平;2025年Claude不再只生成代码供人工复制粘贴、可直接运行代码后,人均产出开始抬升;2026年模型实现长时间自主作业后,产出增速再度暴涨。
两处增长拐点详见配套柱状图。2026年二季度,工程师日均合入代码量达到2024年的8倍。该数据来源于工程师负责统筹审核、由Claude执笔编码。
![]()
注:代码行数并非完美的生产效率衡量指标,只统计数量无法体现代码质量,因此8倍日均代码产出一定程度高估了真实效率提升,但依然能够佐证研发提速。Anthropic内部绩效考核从不以代码行数作为评判标准,员工产出激增的核心原因是借助AI完成编码工作。
代码产出涨幅和研发人员主观效率反馈吻合:2026年3月面向全公司130名科研岗员工的调研显示,在原本就需要落地的同类项目中,受访者中位数预估,依托Mythos Preview的工作效率是无AI辅助状态下的4倍。
我们预判实际效率增幅略低于该估值,但调研结论和多维度观测结果相符:Anthropic大量技术人员依靠AI协助,核心工作落地效率实现数倍提升。
我们还发现,Claude落地了大量原本因人力受限无法推进的工作,例如前沿探索工具开发、积压已久的工程代码清理。
2026年4月,Claude一次性提交800余项程序补丁,将某一类API报错概率降低千倍;对接项目的工程师估算,同等工作量交由人工落地需要整整四年——跨项目排查零散故障耗时繁琐,人类很难同时熟记海量陌生代码上下文。
“大约一年前我开始全面改用Claude完成编码,这段经历堪称颠覆性,我已经连续近五个月没有手动写过一行代码了。”
——Anthropic在职员工
Claude产出代码的质量持续向好,优质代码包含两大标准:可正常运行、逻辑规范便于其他工程师阅读理解与二次迭代。
从可用性维度来看趋势明确:过去一年里,工程师中途叫停、修正、接管Claude任务的频次持续走低,即便是需求模糊、没有标准答案的开放性项目也同样适用,不同难度任务的通过率变化详见折线图。
简言之,Claude编写的代码能够稳定生效。
![]()
图表说明:任务会话成功率由Claude模型担任裁判判定,AI全程独立完成需求、无需人工修正即算作任务成功;研发任务量级浮动会造成成功率短期小幅波动。
2026年5月,在最难的开放式项目中,Claude任务成功率达到76%,半年内涨幅50个百分点。
举例:一次常规版本升级引发数万条训练任务崩溃,工程师仅提供故障描述与集群访问权限交由Claude排查;AI逐个测试运行实例与环境参数,最终定位一处罕见调试标记导致异常,复现故障并输出可行补丁,耗时两小时完成人类需要两到三天的排查工作。
在代码可读性层面,AI与人类的差距仍存,但正在快速收窄。内部员工观点虽未完全统一,但多数人表示:2025年末Claude代码质量整体不及人工,到如今二者水准基本持平,预计年内AI代码质量将全面超越人工。
代码审核流程也随之迭代:所有待合入代码变更都要先经过自动化Claude审核,自动筛查漏洞、安全隐患与各类缺陷。
回溯历史项目数据发现:若过往全量代码变更都启用该自动化审核,claude.ai线上故障中约三分之一的漏洞可以在上线前被提前拦截,而这些代码的编写者本身已是全球顶尖AI研发工程师。
“2025年末Anthropic内Claude代码质量略逊人工,当前二者水准持平,我们预计今年之内AI代码质量将实现反超。”
在目标既定的实验优化场景下,Claude表现尤为突出:每次新品发布前我们都会做统一测试,给到Claude一份小型模型训练代码,要求在保证结果校验无误的前提下最大化程序运行效率,目标与评判标准提前锁定,AI通过改写、试运行、反复调参实现提速,整套流程是微型科研闭环。
2025年5月,Claude Opus 4平均实现3倍提速;2026年4月,Claude Mythos Preview提速幅度达到52倍;作为参照,资深人类研究员需要4至8小时才能做到4倍提速。
在目标明确的实验优化细分科研场景中,Claude用时不到一年,从辅助工具进化至性能超人类。
“现阶段研发模式大体是:人类敲定创新思路,模型落地实现、测试、复盘,全流程效率较过去提升一个数量级。”
Claude自主设计科研实验的能力也在进步。2026年4月Anthropic对外发布首项全流程自主科研落地成果:依托Claude的AGENT团队承接一项AI安全开放式课题——弱模型能否可靠监管强模型。AI自主完成假说提出、分组对照实验、跨智能体汇总结论、迭代优化全流程。
该任务存在明确性能上下限:下限为弱监管模型单独工作的效果,上限是强模型基于标准答案训练后的表现。
两名人类研究员耗时一周补齐23%的性能差距;AI集群累计运行800小时、消耗约18000美元算力,补齐97%差距。
客观局限:该实验结论无法直接迁移至商用大模型,课题方向、评分细则仍由人类敲定,但在既定框架内,全部实验方案由AI自主设计,人类仅负责顶层方向把控。
“整项研究我仅在1至2天里提供少量协助就全部落地。倘若新人同事在同等周期拿出该成果,我都会大为惊叹,未来已来。”
Claude辅助科研纠偏、锚定有效研究方向的能力稳步提升。我们调取2026年1至3月真实协作记录:研发人员和Claude共同攻坚开放性课题(例如训练任务异常中断、模型基准跑分异常)时,时常出现研究思路跑偏、绕弯路后再重回正轨的情况。
我们截取思路跑偏前的全部实验信息,交给多款Claude模型预判下一步动作,再由看过完整实验全过程的独立Claude评判AI与人类的决策优劣。
本次测评筛选129处人类决策存在优化空间的节点,并非AI和人类的全维度对等比拼,但这些无标准答案的真实难题,可以纵向对比模型研判能力变化。
2025年11月的Opus 4.5在同类决策中优于人类的概率为51%;2026年4月Mythos Preview提升至64%。科研日常本就是连续的方向抉择,该数据印证AI正在逐步掌握科研所需的关键判断力。配套柱状图展示全系列模型对比数据。
![]()
图表说明:理想上限线由知晓全流程结果的模型作答生成,代表最优决策。
“现阶段人类的核心比较优势,仍是跳出单点任务、立足全局做顶层思考。”
Anthropic未来研发形态推演
现有数据证明,在AI研发链条里人类的工作范畴持续收缩:一旦AI代码质量追平人工,人类将彻底脱离编码工作,仅留存审核职能;若AI代码产出速度持续远超人工审核效率,人工复核就会成为研发瓶颈。
同理,当Claude能够自主落地实验后,人类的工作重心收缩为:筛选值得落地的实验项目。简言之,编码、做实验、产出数据这类落地性工作的人力成本近乎归零,仅剩余算力开销。
当前人类的独有优势集中在科研审美与方向研判:筛选有价值的课题、甄别可信实验数据、及时终止没有前景的研发路线。
“过去职场协作依托人情互助运转,一句‘帮忙调试脚本’就能搭建人际联结,往来间形成协作羁绊;Claude效率极高却不带人情,每一次AI代劳,都意味着一次人际协作机会的流失。”
“项目顺利时我常会迷茫:我的工作似乎毫无价值,AI做的更快更好;但项目全线崩盘、故障无从溯源时,我又恍然发现自己早已跟不上整套系统逻辑。”
反方质疑与回应
一种常见质疑:人类留存的核心工作——课题方向筛选,才是研发的重中之重;失去人类研判,Claude再强也只是高级助手,无法独立驱动AI迭代。
客观来说,现有训练框架与模型架构能否催生自主选题能力尚无定论,但AI行业突破极少依靠灵光一闪式的颠覆性创新:Transformer架构、混合专家模型这类划时代创新数年才出现一次。
行业绝大多数进步来自渐进式迭代:扩容算力、发现故障、修复问题、重复试错,而这套标准化流程恰恰是如今Claude最擅长的领域。
爱迪生所言天才是1%灵感加99%汗水,眼下占绝大多数的重复性落地工作正加速自动化。前沿技术突破的绝大部分环节均可被自动化承接,规模化科研进度本质由算力、工具资源决定,资源体量直接决定实验并发数量与结果产出速度。
即便假设Claude永远无法习得科研选题能力,保守研判现有数据依旧指向加速迭代:人类只需要投入少量精力把控顶层方向,剩余海量落地工作交由AI完成,单人可统筹的研发体量将成倍扩张,AI已经实实在在加快了Anthropic的研发节奏。
乐观研判则基于Claude研判能力的稳步提升:如今尚不成熟的科研审美能力,大概率只是AI又一项从生疏到精通的技能。
AI此前已经完成诸多同类质变:解读笑点逻辑、心智理论推理、破解语言谜题等曾经被视作人类专属的能力,都陆续被模型攻克。
三种未来发展可能性
后续走向取决于两大变量:迭代提速趋势能否延续、人类对应政策与管控选择。我们梳理三类前景:
情景一:增长曲线触顶放缓,现有AI技术全面普及
本文大量数据呈现指数增长,但指数曲线最终往往收敛为S型增长,后续可能出现边际收益递减、增速放缓直至停滞。区分普通研究员与顶尖专家的高阶研判能力,或许无法依靠算力与数据堆叠实现,想要突破瓶颈需要类似替代Transformer的全新架构革新。
除此之外,算力芯片产能、电网扩容、通信带宽等供应链瓶颈,或是突发能源、算力供给骤缩等外部黑天鹅事件,也会打断AI增速、抬升实验室研发成本。
即便模型能力定格在当前水准,全球产业格局也会迎来剧变:Project Glasswing已是前兆,Mythos Preview上线初期就挖掘出全球关键系统上万条高危漏洞,网络安全的瓶颈从漏洞挖掘转为漏洞修补。
当下AI落地实体经济尚在早期,未来百人团队依托多层级AGENT集群,可承接千人规模企业的全部业务。
综合各项数据,我们认为该情景发生概率偏低,所有可量化指标(代码质量、开放式任务通过率等)至今保持稳步上行,尚未出现拐点。该情景能留给各国政府与社会最长的适配窗口期,而余下两种情景迭代更快、留给全人类的准备时间更少。
情景二:AI研发效率持续复利式提升,人类把控顶层方向
该情景下AI落地工作高度自动化,但人类保留科研选题与成果评审权。全行业借助AI实现效率爆炸,百人企业可完成万人甚至十万人规模机构的业务体量,知识性工作、公共服务迎来彻底变革;与此同时技术也存在被滥用风险,例如全域监控、千人级定制化舆论操纵,实现人类团队无法企及的规模化恶意应用。
类似Anthropic的企业里,人类转为和AI协同攻关前沿课题,同步搭建AI可信度校验体系。现有各项数据预示我们正朝这个方向演进,但流程单一环节提速必然催生新瓶颈,这符合计算机领域的阿姆达尔定律,同样适配企业运营。
Anthropic已经出现典型现象——代码量产提速后,人工代码审核成为新卡点;AI高效催生海量新方案、新项目、仿真实验,远超团队人力承接上限。未来,快速识别并疏通瓶颈,或将成为各行各业最核心的竞争力。
情景三:AI完成全链路递归自优化,自主迭代下一代模型
若性能增长趋势延续,AI逐步习得人类创造性科研思维,自主设计迭代后继模型便具备可行性。
该环境下AI迭代速度完全由算力供给、算法优化效率决定,人类从研发主力转向全域监督、模型验证,投入资源搭建AI自主运转的虚拟实验室。具备自研能力的AI会把技术外溢至全学科,推动各行各业颠覆性革新。
对齐难题的走向是最大未知:一种可能是模型对齐程度、科研判断力同步达标,自主研发出人类尚未突破的对齐方案;另一种是AI具备自我约束意识,在风险不可控时主动暂停迭代。
最坏的情况是,现有模型的对齐缺陷随代际迭代不断放大,故障频次持续走高、机理无法解析,最终人类彻底失去管控。
依托现有人类主导的经济体系,我们很难预判全自主递归智能普及后的社会与经济形态,一旦人力失去竞争优势,全球产业链会迎来无法预估的剧变。
即便全自主递归研发落地,民生变化也不会立刻颠覆现有生产规则,阿姆达尔定律同样适用:递归智能能快速在细分领域兑现《Machines of Loving Grace》描述的各类利好,机器人技术大概率紧随递归智能同步爆发;超强算力加速新药临床试验、实体工业落地、新型社会组织模式研发。
但AI无法凭空缩短药物数十年临床观测周期、逾越法定选举流程、瞬间促成人际交往,社会制度、人际关系依旧是现实瓶颈。高速迭代的递归AI与人类社会规则碰撞,后续演化路径无法预判。
人类应当采取的行动
倘若能够合理放缓前沿AI研发节奏,为全人类留出时间完善配套治理与风险研究,客观上利好全球安全;但单方面减速极易让激进研发方弯道超车,最终加剧整体安全隐患。
缺少全球统一协调机制的前提下,各国企业与监管机构只能在地缘博弈与行业竞争中艰难平衡安全红线。
我们支持全球拥有暂缓前沿大模型研发的选择权,为社会治理、对齐研究争取追赶技术的窗口期。
The Anthropic Institute将联合多方机构落地配套研究,搭建可信停摆管控体系:这套机制能够跨国核验顶尖研发机构的真实停工状态,杜绝部分主体借集体减速之名私下秘密研发、实现技术超车。一旦核验体系落地,若全球头部实验室同步可验证式停工,Anthropic愿意跟进暂缓前沿研发。
可信的全球性暂缓协议,需要多国多家头部资源型实验室达成统一条款,配套跨方可落地的核验机制。AI算力研发隐蔽性远超导弹研发,训练项目极易隐匿、软硬件通用性极强,私下违约收益极高,使得这套管控的核验难度远高于传统军备管控。
历史上《中导条约》等国际管控协议耗费数十年搭建基建与互信,但AI行业没有这么长的缓冲周期。单一企业单边停工虽可立刻落地,但仅改变行业龙头格局,无法促成全行业公共治理磋商。
未来数月,我们将牵头组织政策制定者、科研人员、公益组织、同业AI企业开展系列研讨,聚焦递归自优化风险、全球协同管控方案等本文提出的关键议题,并对外公示研讨成果。当下正是全球跨行业共同商讨管控方案的窗口期,AI行业之外的社会各界理应参与其中。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.