网易首页 > 网易号 > 正文 申请入驻

让AI自己给大模型做后训练:AIBuildAI开源递归自进化PostTrain Agent,登顶PostTrainBench

0
分享至



给定一个基座模型、一个目标能力和算力预算,RSI Agent 自己设计后训练算法、收集和整理数据、写代码、跑实验、迭代改进,最终交出一个训练好的模型,全程无人介入。在自主后训练基准 PostTrainBench 上,它以 46.6 分排名第一,超过所有前沿模型与 Agent 系统,接近人类专家表现(51.1)。

近日,AIBuildAI 团队发布了PostTrain Agent,一个用于自主后训练大语言模型的递归自我改进(RSI)Agent,并开源了全部代码与配套知识库。

  • 开源地址:https://github.com/aibuildai-inc/aibuildai-llm-posttrain-agent
  • 知识库:https://github.com/aibuildai-inc/aibuildai-knowledge-base
  • 技术报告:https://github.com/aibuildai-inc/aibuildai-llm-posttrain-agent/blob/main/docs/aibuildai-llm-post-train-agent.pdf

为什么需要自动化的后训练

后训练(post-training)是把一个基座模型变成能遵循指令、会推理、会用工具、懂某个领域的模型的过程——也是一家公司把通用模型变成「自己的模型」的方式。它涉及的决策不少:用什么数据、怎么配比;用监督微调(SFT)、偏好优化还是强化学习;学习率、训练步数、最后交付哪个 checkpoint。

这些决策彼此耦合:合适的算法取决于数据配比,有效的数据配比又取决于基座模型。交付一个后训练好的模型,往往要一个有经验的团队花上数周,每次实验还要消耗可观的算力。AIBuildAI PostTrain Agent 研究的问题是:能否把这件事完全交给 AI——输入基座模型、目标能力和算力预算,Agent 自己完成后训练的全部流程,输出一个后训练好的模型。

PostTrainBench:给 Agent 的一道考题

PostTrainBench(Rank et al., ICML 2026)把这个问题做成了一个基准:给定基座模型(如 Qwen3-4B-Base)和目标能力(如工具调用),Agent 在单张 H100 上、10 小时内自主设计并执行后训练方案,产出的 checkpoint 在基准方持有的、Agent 看不到的评测集上打分。基准覆盖 4 个基座模型和 7 类任务:数学推理(AIME 2025、GSM8K)、写作(ArenaHard Writing)、通用问答(GPQA)、健康咨询(HealthBench)、代码(HumanEval)和函数调用(BFCL)。

用哪些外部数据、怎么混合,用监督微调、偏好优化还是强化学习,超参数和训练框架——全部由 Agent 自己决定。



图 1|PostTrainBench 的任务设定:输入基座模型和目标能力,Agent 在单张 H100、10 小时内自主设计并执行后训练,产出的 checkpoint 在 Agent 看不到的评测集上打分。

从一条线到一棵树

榜单上的基线做法,是把一个编码 Agent(如 Claude Code)直接指向这个任务:一个会话、一个 CLI 环境,给它基座模型、数据、GPU 和评测器,让它自己规划、写代码、训练、评估。这样的 Agent 是线性搜索的:每次尝试都是在修改上一次,方案很早就定下来,之后一路跟着走;几个截然不同的思路无法并行探索,一条已经走不通的方向会把剩余预算全耗掉。它的数据、方法和超参数选择也只来自模型自身的参数化知识。

AIBuildAI 此前的系统(AIBuildAI Science、AIBuildAI-2.5)用的是整实验树搜索:一次运行是一棵实验树,每个节点是一次完整的实验,由任务自己的评测程序打分,运行的价值就是树上的最高分。「设计员」Agent 播下若干条刻意互异的起始方案,每条方案是一个分支的根;「实验员」Agent 端到端地跑完一个实验并提出几条修改,成为子实验;「选择器」按预期收益、证据、新颖性和成本给等待 GPU 的候选实验排序。



图 2|整实验树搜索:设计员给出若干互异的起始方案,实验员逐节点完成整个实验并提出修改,选择器为候选排序;每个节点由任务自己的评测程序打分。

但直接把这套流程搬到后训练上,暴露出两个限制:一是它不懂这个领域——实验员只能凭语言模型内部知识作答,典型错误包括选了没有任何库实现的方法、用了和评测集重叠的数据集、套用了另一种模型规模的超参数,每个错误都要花一整次训练才能发现;二是它在了解任务之前就定死了搜索的拓扑——树的每个节点都必须是一个打过分的模型,而「生成数据」这样的阶段没有分数、做不了节点;把不同节点里训练好的几个模型合并成一个(fan-in),树搜索也表达不了。针对这两个问题,新系统引入了两个核心组件:知识系统和元搜索。



图 3|AIBuildAI PostTrain Agent 系统总览:元 Agent 调研任务并写出搜索程序,由它派生的实验员 Agent 和程序负责执行,所有 Agent 共用同一套知识系统。

知识系统:让 Agent 依据证据而非记忆做决策

AIBuildAI PostTrain Agent 的知识系统是一个通过 MCP 提供服务的远程检索知识库,里面是一套「知识文件」,分四个子库:工作流(一次后训练运行的 13 个有序步骤、34 份文件,每步说明要落定的判断、一个具体案例和它的适用边界)、方法(111 份文件:监督微调、DPO、GRPO、蒸馏等,各自需要什么、花费多少、有哪些参数和默认值)、数据集(215 份文件:许可证、切分、加载代码、样本行,并标出哪些是评测基准、必须隔离)、框架(108 份文件:何时选它、如何启动、监控和保存一次训练)。



图 4|AIBuildAI PostTrain Agent 知识系统:实验员带着问题查询知识库,取回匹配的知识文件,并在实验结束后把观察写回。

每份知识文件都从公开来源(论文、库代码、Hub 上的数据集说明、公开训练记录)收集,经人工确认范围、检查许可和切分、从代码中实测事实后,按统一模板写成,每条声明都带 URL 和日期;任何提到评测基准的文件都会被剔除出语料。实验员在面临设计决策时,把「任务、当前方案、哪里出了问题」发给知识库,拿回匹配的知识文件,据此决定下一步;跑完的实验也会把观察写回,知识随之增长。

这些文件记录的不是教程,而是可以直接据以行动的判断。以工作流的第一步为例,它要求 Agent 在选任何数据之前先读懂「分数到底奖励什么」:评分看的是最终答案还是整段回复,格式错误是否直接记零分,推理过程有没有分;然后在未经训练的基座模型上完整跑一次官方评测器——得到的数字才是基线,跑一次的耗时则是后面分配预算时的「单次评测成本」。方法文件则给出每种方法的适用条件、目标函数、一个带数字的算例、需要的数据形态和额外模型,以及哪些库提供了现成实现。

元搜索:搜索的拓扑本身成为 Agent 的输出

不同的任务需要不同形状的搜索。线性搜索适合方案已定、只需反复打磨同一种方法流程的情形;树搜索适合有几种可信思路、只能靠证据取舍的情形。但后训练里常见一种两者都表达不了的结构。

以一个典型方案为例:先准备两份训练数据——任务自带的训练集和一份从公开语料构建的外部数据集——在基座模型上各做一次监督微调,用验证集选出更好的模型作为「当前最优」;然后进入强化学习阶段:每一轮都从当前最优出发做一轮 GRPO 训练,训练完在验证集上打分,只有分数确实提高才用新模型替换当前最优,否则丢弃,如此反复,直到预算不够再跑一轮。

这个方案是树搜索放不进去的:树的每个节点都必须是一个训练完、打过分的模型,而「构建外部数据集」这一步只产出数据,没有模型也没有分数,做不了树上的节点。



图 5|一个线性搜索和树搜索都表达不了的后训练方案。虚线框是只产出数据、没有模型也没有分数的阶段,红点表示打过分的模型。

AIBuildAI PostTrain Agent 的解法是元搜索:先派出一个元 Agent,它调研任务、阅读设计知识文件(37 种带可运行示例的搜索模式:链式、扇出/扇入、循环、分阶段流程,以及 checkpoint 锦标赛、监督微调接 GRPO、预算约束的多轮训练等后训练专属策略)、查询知识库,然后写出一个搜索程序。程序的每一步可以是 LLM Agent、确定性程序或嵌套的子搜索,整体可以是任何执行图——阶段、锦标赛、扇入、循环。上面那个案例写成程序不过几行:两路监督微调、取优、在预算允许时循环 GRPO。

搜索程序由三种基本单元组合而成:Agent 是一个带工具和类型化输出的 LLM 会话,Program 是在独立资源限制下运行的确定性计算,Search 则把 Agent、Program 和嵌套的 Search 编排在一起。37 种模式是词汇表而不是白名单,元 Agent 可以组合、改造,也可以写出目录之外的结构。

搜索程序也不必在开跑前把整次运行定死:元 Agent 可以只写当前阶段的程序——构建一份语料,或一轮训练加评估——执行完后读取剩余预算,交给下一代元 Agent 根据实测结果写下一阶段。运行的结构由此一个阶段一个阶段地、基于实测而非事前预测来决定。



图 6|元搜索:元 Agent 阅读任务与设计知识文件、查询知识库,写出由 Agent、Program、Search 三种基本单元组成的搜索程序。

实验分析

所有实验都遵循 PostTrainBench 榜单的设定:每个任务在单张 H100 上全自动运行 10 小时,全程无人干预;AIBuildAI 的所有 Agent 角色均运行在 Claude Opus 5 上,所有结果都由元搜索产生。对比数字取自 PostTrainBench 公开榜单。

综合得分:超过所有前沿模型与 Agent 系统

在 PostTrainBench 上,AIBuildAI PostTrain Agent 的加权综合得分为 46.6,高于所有前沿模型和 Agent 条目,仅次于人类专家基线的 51.1。榜单上紧随其后的是 Locus(45.6)和运行 Claude Fable 5 的 Claude Code(41.8),再往后是 GPT-5.6(36.2)、Claude Opus 5(35.0)、Claude Opus 4.8(33.8)、Kimi K3(32.0)、GLM-5.2(31.7)、Gemini 3.1 Pro(22.0)等。未经任何训练的基座模型平均只有 7.5 分——也就是说,Agent 在 10 小时内把综合得分提高了约 39 分。



图 7|PostTrainBench 综合得分。综合分是七项任务的加权平均(AIME 2025 22.7%、GPQA 22.5%、HealthBench 18.4%、HumanEval 10.6%、GSM8K 9.4%、ArenaHard Writing 9.0%、BFCL 7.5%),每项任务取 4 个基座模型的均值。Human 为各基座模型官方发布的指令微调版本,不受 10 小时预算限制。

同一个底层模型,换一套系统:+11.6 分



各任务为 4 个基座模型的均值。Δ 为 AIBuildAI 与 Claude Code 之差,二者均运行 Claude Opus 5。

一个更能说明系统本身价值的对照是:AIBuildAI 的全部 Agent 角色都运行在 Claude Opus 5 上,而同样运行 Opus 5 的 Claude Code 只有 35.0 分——相差 11.6 分,来自系统而非模型。分任务看,AIBuildAI 在七项中的六项领先,GPQA 持平。

提升最大的三项是 BFCL(+94.3)、ArenaHard Writing(+12.1)和 HumanEval(+9.2)。值得注意的是,AIBuildAI(Opus 5)的 46.6 也高于运行更强模型 Claude Fable 5 的 Claude Code(41.8):知识系统与元搜索带来的增益,超过了把底层模型升级一代所带来的增益。

分任务分析:三项任务取得 Agent 最高分,其余四项与领先者相差不到两分

与榜单上的全部 Agent 相比,AIBuildAI 在 AIME 2025(15.8,其后为 Claude Fable 5 的 13.3 和 Locus 的 9.4)、BFCL(95.8)和 HumanEval(69.0,Locus 为 66.6)三项上取得最高分;在 ArenaHard Writing、GPQA、HealthBench 和 GSM8K 四项上,与各自领先者的差距都在两分以内。

这些差距背后是不同的机制。BFCL 按函数调用能否被正确解析、是否符合给定的 schema 计分,格式稍有不符即记零分:同样运行 Opus 5 的 Claude Code 平均只有 1.5 分,与未训练的基座模型持平;AIBuildAI 借助知识系统选对了训练框架和格式匹配的数据集,在四个基座模型上的得分全部不低于 94,平均 95.8,也是七项任务中唯一超过人类参考(85.0)的一项。

ArenaHard 是成对偏好评判,本质上是选哪个偏好语料的数据选择问题。AIME 的答案可验证,「采样—验证—重训」是一个循环,正是元搜索的用武之地;它在综合分中权重最大,也是所有 Agent 距人类参考最远的一项,AIBuildAI 在每个基座模型上都取得了最高或并列最高的 Agent 得分,包括最难的 gemma-3-4b-pt(3.3 分,其他 Agent 均不超过 1.1)。HumanEval 上,AIBuildAI 在全部 4 个基座模型上都是 Agent 最高分。HealthBench 用的是医生撰写的评分标准,需要一套不让评判者奖励冗长回答的偏好优化流程。



图 8|七项任务在 4 个基座模型上的逐项得分。Official instruct 为各基座模型官方发布的指令微调版本,是参考而非参赛的 Agent。

两个案例:Agent 如何一步步把分数做上去

两个案例中,Agent 都在运行自己的那张 GPU 上部署了一个开源权重的教师模型来写训练数据,并且一次只规划一个阶段、依据实测结果决定下一步。

HealthBench × Qwen3-4B-Base(基座 13.4 → 48.6,Claude Code 为 40.9):先让教师模型写出约 4.8 万条回复,在其上做监督微调,得到 46.2 分;再让教师模型写约 6,800 段更长的多轮对话继续训练,在小子集上筛选候选、在完整评测集上确认,达到 48.6 分。

ArenaHard Writing × SmolLM3-3B-Base(基座 0.4 → 74.6,Claude Code 为 69.7):先在约 2 万条教师撰写的语料上做监督微调,并对最后三个 checkpoint 做权重平均,得到 74.2 分;再做一轮拒绝采样——从学生模型自己的回复中挑出被教师评为最优的继续训练——再次平均后达到 74.6 分。

两次运行中,绝大部分增益都来自在教师数据上的第一轮完整训练;此后每个阶段的结果,只有在完整评测集上确认有效才会保留。

元 Agent 写出的搜索程序长什么样

以 AIME 2025 × Qwen3-1.7B-Base 为例。元 Agent 动手写程序之前先做了调研:未经训练的基座模型只有 20% 的回复会给出评测器要求的答案行,23% 的题目一直生成到长度上限也不结束;给两个格式示范,答案行比例升到 73%,准确率却完全没有变化。

元 Agent 据此判断格式不是瓶颈,真正待解的问题是一个 1.7B 的模型能学会多长的推理链,并写出了一个五阶段的搜索程序:在 CPU 上并行构建短、中、长三种思维链长度的语料,同时在 GPU 上保存并评测基座模型,以确立基线和单次评测成本;每份语料各做一次小预算的试训;由一个策略 Agent 读取基线、三次试训和语料筛查的结果,决定主训练用哪份语料、是否从试训的 checkpoint 续训、要不要第二阶段;随后是主训练;最后是可选的第二阶段(续训、长度退火、拒绝采样微调或 DPO 四选一)。

整个程序共 471 行 Python、8 个文件(1 个搜索编排器、5 个 Agent 角色、2 个确定性程序),全部由元 Agent 在任何训练开始之前的一次会话中生成。

总结与展望

AIBuildAI PostTrain Agent 表明,大模型后训练正在从「由人类专家操作工具」,迈向「由AI自主完成研发闭环」。在底层模型同为 Claude Opus 5 的条件下,AIBuildAI 以 46.6 分显著领先 Claude Code 的 35.0 分,在七项任务中六项领先、一项持平,并将与人类专家参考(51.1)的差距缩小到不足 5 分。这说明,决定 Agent 能力上限的不只是底层模型本身,还包括它能否基于可靠知识进行决策、能否设计适合任务的搜索结构,以及能否从实验结果中持续学习和调整。

更重要的是,PostTrain Agent 所自动化的并非某个固定训练流程,而是完整的模型研发过程:理解目标、研究任务、准备数据、设计算法、编写代码、运行训练、评估结果,并根据实验反馈重新制定下一阶段方案。在这一过程中,AI 不再只是执行人类预先写好的训练配方,而是开始自主提出假设、构建实验、分析证据并迭代改进。这正是递归自我改进(RSI)在模型研发场景中的一种具体实现。

从更长远的角度看,自动化后训练只是起点。同样的范式可以进一步覆盖预训练、数据生成、模型架构设计、推理优化、评测、安全对齐与部署,最终形成一个能够自主设计、训练、验证和持续改进 AI 模型的研发系统。人类只需定义目标、约束与价值标准,AI便能在给定资源下搜索实现这些目标的最佳模型和算法。

当模型能够参与改进下一代模型,AI 研发将不再完全受限于人类专家的时间、经验和试错速度,而可能演化为一个由机器规模化执行、由实验反馈持续驱动的过程。AIBuildAI 希望构建的,正是这样的 AI 研发基础设施:让 AI 自主研发 AI,并把模型创新从少数顶尖团队才能完成的复杂工程,转变为任何组织都可以调用的能力。

参考文献:

[1] AIBuildAI LLM-Post-Train Agent: an agent for autonomous post-training of large language models. AIBuildAI Team, 2026.

[2] PostTrainBench: Can LLM Agents Automate LLM Post-Training? Rank et al., ICML 2026.

[3] AIBuildAI: An AI Agent for Automatically Building AI Models. Ruiyi Zhang, Peijia Qin, Qi Cao, Li Zhang, Pengtao Xie, 2026. ttps://arxiv.org/abs/2604.14455

[4] AIBuildAI-2: A Knowledge-Enhanced Agent for Automatically Building AI Models. Ruiyi Zhang, Peijia Qin, Qi Cao, Li Zhang, Pengtao Xie, 2026. https://arxiv.org/abs/2605.27873

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
国庆过半六大爆火旅游城市出炉!成都断层第一,京沪渝西杭上榜

国庆过半六大爆火旅游城市出炉!成都断层第一,京沪渝西杭上榜

另子维爱读史
2026-10-06 20:01:27
又一品牌“切割”:对于蔡康永不当行为强烈震惊、坚决反对,下架全部内容,保留追究责任权利

又一品牌“切割”:对于蔡康永不当行为强烈震惊、坚决反对,下架全部内容,保留追究责任权利

大风新闻
2026-10-06 15:47:16
“拿筷子姿势恶心死了!”一段贫民窟小公主吃饭视频,给网友看力竭了!

“拿筷子姿势恶心死了!”一段贫民窟小公主吃饭视频,给网友看力竭了!

番外行
2026-09-30 21:42:16
咖啡竟会使人更“易燃易爆炸”?!最新Nat. Commun.:咖啡会通过肠道-脑轴,牵动情绪、认知和免疫,含咖啡因与脱咖啡因各有侧重

咖啡竟会使人更“易燃易爆炸”?!最新Nat. Commun.:咖啡会通过肠道-脑轴,牵动情绪、认知和免疫,含咖啡因与脱咖啡因各有侧重

梅斯医学
2026-10-07 07:55:50
我国在编警察有多少人?

我国在编警察有多少人?

网观天下
2026-10-07 12:44:45
你见过哪些因作死,亲手毁掉自己婚姻的人?网友:十倍做空闺蜜

你见过哪些因作死,亲手毁掉自己婚姻的人?网友:十倍做空闺蜜

游戏收藏指南
2026-10-06 16:58:13
出门尽量不点的5道菜,有的不洗就下锅,老板:不是厨师就是内行

出门尽量不点的5道菜,有的不洗就下锅,老板:不是厨师就是内行

神牛
2026-10-04 13:14:19
日媒:亚洲国家联赛将减少日本与其他大洲交手机会

日媒:亚洲国家联赛将减少日本与其他大洲交手机会

懂球帝
2026-10-07 15:29:22
日本4家啤酒巨头涉嫌达成垄断协议,日本政府机构启动调查

日本4家啤酒巨头涉嫌达成垄断协议,日本政府机构启动调查

环球网资讯
2026-10-07 11:09:05
梅罗差距最大的一天!两种告别:梅西的“团队”与C罗的“自我”

梅罗差距最大的一天!两种告别:梅西的“团队”与C罗的“自我”

智道足球
2026-10-07 17:47:15
紧急叫停!医生:服用阿托伐他汀的人,出现这 3 种症状必须停药

紧急叫停!医生:服用阿托伐他汀的人,出现这 3 种症状必须停药

路医生健康科普
2026-10-07 06:20:07
美国为何没有贪官?不是没有,是因为美国从制度上消灭了贪官,就连贪污都是合法的

美国为何没有贪官?不是没有,是因为美国从制度上消灭了贪官,就连贪污都是合法的

扶苏聊历史
2026-09-12 17:43:57
男性衰老的标志:1臭、2大、3小,如果你没有,说明还年轻!

男性衰老的标志:1臭、2大、3小,如果你没有,说明还年轻!

医学科普汇
2026-08-04 20:10:07
当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

坠入二次元的海洋
2026-09-11 00:35:48
具俊晔守墓一年多,在大S冥诞以三句英文回应质疑:依然深爱,不回韩国

具俊晔守墓一年多,在大S冥诞以三句英文回应质疑:依然深爱,不回韩国

八卦宝宝
2026-10-07 14:42:12
斯卡洛尼:今后无法再倚仗梅西了,弥补空缺唯一办法是靠团队

斯卡洛尼:今后无法再倚仗梅西了,弥补空缺唯一办法是靠团队

懂球帝
2026-10-07 11:58:06
浙牌车主晒上海违章15条合计2400元,评论区炸了

浙牌车主晒上海违章15条合计2400元,评论区炸了

小虎新车推荐员
2026-10-07 14:01:27
“711”的薛其坤被嘲讽,错在媒体把科学报道当励志鸡汤

“711”的薛其坤被嘲讽,错在媒体把科学报道当励志鸡汤

晓看说
2026-10-07 14:44:50
极光丝袜高跟,从容极致优雅有氛围感

极光丝袜高跟,从容极致优雅有氛围感

艾斯莱斯奈斯
2026-10-06 16:23:24
麒麟9050 Pro拆开后完整展示韬定律:华为竟用2颗相同芯垂直堆叠而成

麒麟9050 Pro拆开后完整展示韬定律:华为竟用2颗相同芯垂直堆叠而成

快科技
2026-10-05 18:16:06
2026-10-07 18:04:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14142文章数 142744关注度
往期回顾 全部

科技要闻

万亿砸向高速充电桩,排队为何仍是无解?

头条要闻

演员王星被骗至妙瓦底4天遭转卖3次 向女友发求救暗号

头条要闻

演员王星被骗至妙瓦底4天遭转卖3次 向女友发求救暗号

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

娱乐要闻

吴奇隆举旗活动取消,不赚钱也守立场

财经要闻

谷歌签下科技史上最大核能协议

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

数码
房产
亲子
手机
家居

数码要闻

赛睿、KontrolFreek发布《堡垒之夜》联名游戏外设,覆盖广泛类别

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

亲子要闻

原来我不是羡慕有钱人,是羡慕幸福的人

手机要闻

李杰:全局165Hz超高刷需要屏幕硬件支持,目前行业里只有一加16可以

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版