![]()
代码、视觉、安全共用一套 RL,奖励机制也被重新设计。
作者丨郑佳美
编辑丨岑 峰
刚刚,小米正式发布并开源 MiMo-V2.6。Pro 拥有 1.02T 总参数、42B 激活参数,Flash 为 309B 总参数、15B 激活参数,两款模型支持 1M token 上下文,并覆盖文本、图像、视频和音频输入。
如果只看这些数字,第一反应或许会觉得这又是一次模型规模升级。但这次小米投入更多篇幅讨论的,其实是模型完成预训练之后,能力还能怎样继续往上推。
![]()
这也是为什么后训练成了 MiMo-V2.6 的核心部分。小米把代码、通用 Agent、视觉和网络安全任务放进同一套强化学习系统,单次 RL 更新使用 1568 个 prompt,每个 prompt 生成 16 条 rollout。
和普通问答不同,Agent 在这些任务里不是生成一段文本就结束,而是要不断读取环境、搜索信息、调用工具、执行操作,再根据返回结果调整下一步行动。训练对象因此不再只是最终答案,而是一整条包含状态、决策和反馈的行为轨迹。
![]()
当强化学习开始围绕这种长轨迹展开,问题自然也变了。模型不仅要承担更长上下文和持续生成带来的计算开销,还要同时处理大量执行时间完全不同的任务,等轨迹数量真正上来以后,单纯依靠成功或失败这样的奖励,又很难判断两条都完成任务的路径,哪一条更值得模型学习。
所以 MiMo-V2.6 后面的架构、异步训练和奖励设计,基本都是从这些实际问题里一步步长出来的。
01
1M 上下文背后
Agent 一旦开始长期停留在环境里,模型面对的计算形态就发生了变化。
以软件工程任务为例,模型可能先读取大量代码,随后搜索文件、修改函数、运行测试,再根据 terminal 返回继续行动。早期读取的内容需要留在上下文里,但当前一次决策真正频繁使用的,往往只是正在处理的代码、最近几轮工具结果以及局部状态。
MiMo-V2.6-Pro 的注意力结构正好利用了这种特征。70 层 Transformer 中,60 层采用 Sliding Window Attention,窗口只有 128 token,另外 10 层使用 Global Attention。也就是说,绝大多数层只处理附近信息,隔一段距离再由全局层完成长距离通信。
![]()
这样设计之后,1M 上下文并不意味着每一层、每一个 token 都要重新和完整上下文进行交互。当前操作需要的局部信息可以高频流动,远处的信息则通过少量全局层重新汇合。对于长时间运行的 Agent,这比把完整注意力铺满整个网络更符合实际工作负载。
参数侧采用了类似思路。Pro 虽然拥有 1.02T 总参数,每个 token 实际只激活约 42B 参数,每个 MoE 层有 384 个 routed expert,其中只调用 8 个。模型因此可以维持较大的专家容量,又不需要让每个 token 穿过全部参数。
这里的意义放到 RL 阶段会更明显。一次回答多算几个 token,成本差异有限,一次训练里同时生成数万条 rollout,每条轨迹又持续几十轮,任何单 token 计算量的增加都会被迅速放大。
![]()
MiMo-V2.6 还加入了 5 层 MTP speculative decoder,drafter 一次前向可以尝试给出后续多个 token,再交给主模型并行验证。官方模型卡给出的设计是一次前向预测后续 7 个 token。
SWA、Sparse MoE 和 MTP 放在一起看,就能看出 MiMo-V2.6 架构上的取舍:大容量负责装下能力,稀疏计算和局部注意力控制每一步的代价,推测解码则继续提高生成速度。
当单条轨迹能够以更低成本持续生成,RL 才有空间把 rollout 的数量推上去。而到了 MiMo-V2.6 这种一次更新就产生两万多条轨迹的规模,计算压力开始从模型内部蔓延到整个训练系统。
![]()
02
RL 开始像分布式生产系统
1568 个 prompt,每个采样 16 条 rollout,一次更新对应 25088 条 trajectory。困难之处在于,这 25088 条轨迹不会按照统一节奏结束。
有的代码任务几轮操作就找到问题,有的会不断运行测试、读取报错再重新修改;网络安全任务可能经历多次环境验证,视觉 Agent 又有不同的执行链路。轨迹长度、工具延迟和环境响应混在一起以后,一个 batch 内部很容易出现明显的长尾。
如果继续采用严格同步方式,已经完成任务的计算资源需要等待少数仍在运行的轨迹。规模越大,这种等待造成的资源浪费越明显。
MiMo-V2.6 用 fully asynchronous GRPO,把 rollout、环境执行、grader 和模型更新拆开运行。生成侧完成一条轨迹后可以继续领取任务,环境执行与评分各自推进,训练侧消费已经准备好的数据,不再要求一整个 batch 同时跨过每个阶段。
这种变化看起来属于工程优化,却直接影响了小米怎样组织 RL 数据。
MiMo-V2.6 没有为代码、通用 Agent、视觉和网络安全分别训练一套独立策略,而是把多领域任务以及不同 Agent harness 混入同一次 RL,小米将其称为 You Only RL Once。
![]()
原因在于这些任务虽然环境不同,内部却共享大量决策结构。模型需要判断当前状态缺什么信息、该调用哪个工具、执行结果是否符合预期、失败以后应该继续搜索还是修改方案。多个领域一起训练,这些行为策略可以直接在同一个 policy 中发生迁移。
多个 harness 的作用则更隐蔽。不同框架会改变 system prompt、工具定义和上下文组织方式,模型反复面对不同交互外壳后,就更难把某一种固定接口当成解题捷径。训练压力逐渐落到状态理解、工具选择和环境反馈这些更底层的能力上。
![]()
走到这里,Agent RL 的瓶颈已经发生了一次变化。模型能够比较高效地产生长轨迹,异步系统也能够持续吞吐不同环境,真正稀缺的东西开始变成轨迹里的有效反馈。
因为 25088 条 trajectory 并不天然等于 25088 份高质量训练信号。
03
从 GRS、GAR 到 MOPD2
传统可验证 RL 很依赖 binary reward。代码通过测试得到正向奖励,失败则没有。对于短任务,这种反馈已经足够清晰,但放进几十步甚至更长的 Agent 轨迹以后,大量过程差异会被压成同一个数字。
假设同一道任务生成 16 条 rollout,其中 5 条通过测试。一条可能快速定位根因,只修改必要代码。另一条经历大量无效搜索,还有一条虽然通过测试,却引入许多额外修改。只看 pass / fail,这几条成功轨迹很难拉开差距。
MiMo-V2.6 因此把 grader 从结果检查器进一步变成组内比较器。
GRS,也就是 Groupwise Reward Synthesis,会同时观察同一道任务产生的多条 rollout,从它们之间已经出现的差异中构造 task-specific rubric,再把过程质量与测试结果结合起来。评价标准因此会随着当前 policy 实际暴露出来的问题发生变化。
GAR(Groupwise Advantage Redistribution)则进一步影响策略更新。即使几条 trajectory 全部完成任务,grader 仍会继续比较它们,再把更多 advantage 分配给质量较高的方案。
官方也明确提到,这套过程会结合环境加固、异常筛查和 verifier cross-check 来处理 reward hacking。这里带来的变化很直接:RL 的计算投入不再只用来制造更多样本,还开始投入到理解样本。
![]()
当 rollout 数量已经很大时,再增加一批只有 0 和 1 的轨迹,信息增量可能有限,grader 如果能够继续拆出成功方案之间的质量差异,同样一轮环境交互便能产生更丰富的梯度信号。
可验证任务能够依赖这一套机制,开放式 Agent 却还有另一类困难。很多任务缺少稳定的自动 verifier,即使模型完成了一段复杂操作,也很难仅靠环境给出可靠评分。
MiMo-V2.6 在混合 RL 之后又加入 MOPD2,也就是 Multi-Prefix Multi-Teacher On-Policy Distillation。它会复用 Teacher trajectory 和 SFT demonstration 中已经存在的历史,把轨迹截取到某个中间状态,再让学生从这里继续 rollout。
假设一条 Agent 任务需要 40 步才能到达关键决策位置,训练这个位置时就不必反复生成前面 39 步。历史状态可以直接作为 prefix,训练资源集中到后续决策,同时一条教师轨迹还能提供多个可复用的训练起点。
GRS 和 GAR 解决的是可验证任务中反馈过粗的问题,MOPD2 则把高质量教师轨迹中的决策信息带进难以自动评分的区域。
MiMo-V2.6 也因此把 RL 的扩张从 rollout 数量继续推进到了反馈密度和轨迹复用。
04
Agent RL 正在从算法变成系统工程
MiMo-V2.6 给出的信号,其实已经超出了某一种 RL 算法本身。
Agent 进入真实环境以后,训练数据不再只有静态 token,还多出了状态、工具调用、执行结果、错误反馈和连续决策。模型需要亲自走过这些过程,才能产生一条能够用于强化学习的 trajectory。
这也让后训练的竞争维度发生了扩展。模型架构要能够承受长时间生成,分布式系统要持续运行大量异步环境,grader 要从成功轨迹中进一步拆出质量差异,教师轨迹还要被复用到难以自动验证的任务里。
MiMo-V2.6 依然运行在人设计的任务、环境、评分机制和训练框架内,但它展示出一种很清晰的方向:Agent 能力提升越来越依赖整个训练闭环的吞吐和反馈质量。
参数继续扩大当然还有价值,只是到了 Agent 阶段,另一个变量已经越来越难忽略 —— 一套训练系统能够生产多少有价值的行为轨迹,又能从这些轨迹里转化出多少有效的学习信号。
MiMo-V2.6 的技术意义,更多就落在这里。
参考链接: https://mimo.xiaomi.com/zh/mimo-v2-6
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.