网易首页 > 网易号 > 正文 申请入驻

深度拆解 MiMo-V2.6:1M 上下文只是表面,2.5 万条轨迹才是底牌

0
分享至


代码、视觉、安全共用一套 RL,奖励机制也被重新设计。

作者丨郑佳美

编辑丨岑 峰

刚刚,小米正式发布并开源 MiMo-V2.6。Pro 拥有 1.02T 总参数、42B 激活参数,Flash 为 309B 总参数、15B 激活参数,两款模型支持 1M token 上下文,并覆盖文本、图像、视频和音频输入。

如果只看这些数字,第一反应或许会觉得这又是一次模型规模升级。但这次小米投入更多篇幅讨论的,其实是模型完成预训练之后,能力还能怎样继续往上推。


这也是为什么后训练成了 MiMo-V2.6 的核心部分。小米把代码、通用 Agent、视觉和网络安全任务放进同一套强化学习系统,单次 RL 更新使用 1568 个 prompt,每个 prompt 生成 16 条 rollout。

和普通问答不同,Agent 在这些任务里不是生成一段文本就结束,而是要不断读取环境、搜索信息、调用工具、执行操作,再根据返回结果调整下一步行动。训练对象因此不再只是最终答案,而是一整条包含状态、决策和反馈的行为轨迹。


当强化学习开始围绕这种长轨迹展开,问题自然也变了。模型不仅要承担更长上下文和持续生成带来的计算开销,还要同时处理大量执行时间完全不同的任务,等轨迹数量真正上来以后,单纯依靠成功或失败这样的奖励,又很难判断两条都完成任务的路径,哪一条更值得模型学习。

所以 MiMo-V2.6 后面的架构、异步训练和奖励设计,基本都是从这些实际问题里一步步长出来的。

01


1M 上下文背后

Agent 一旦开始长期停留在环境里,模型面对的计算形态就发生了变化。

以软件工程任务为例,模型可能先读取大量代码,随后搜索文件、修改函数、运行测试,再根据 terminal 返回继续行动。早期读取的内容需要留在上下文里,但当前一次决策真正频繁使用的,往往只是正在处理的代码、最近几轮工具结果以及局部状态。

MiMo-V2.6-Pro 的注意力结构正好利用了这种特征。70 层 Transformer 中,60 层采用 Sliding Window Attention,窗口只有 128 token,另外 10 层使用 Global Attention。也就是说,绝大多数层只处理附近信息,隔一段距离再由全局层完成长距离通信。


这样设计之后,1M 上下文并不意味着每一层、每一个 token 都要重新和完整上下文进行交互。当前操作需要的局部信息可以高频流动,远处的信息则通过少量全局层重新汇合。对于长时间运行的 Agent,这比把完整注意力铺满整个网络更符合实际工作负载。

参数侧采用了类似思路。Pro 虽然拥有 1.02T 总参数,每个 token 实际只激活约 42B 参数,每个 MoE 层有 384 个 routed expert,其中只调用 8 个。模型因此可以维持较大的专家容量,又不需要让每个 token 穿过全部参数。

这里的意义放到 RL 阶段会更明显。一次回答多算几个 token,成本差异有限,一次训练里同时生成数万条 rollout,每条轨迹又持续几十轮,任何单 token 计算量的增加都会被迅速放大。


MiMo-V2.6 还加入了 5 层 MTP speculative decoder,drafter 一次前向可以尝试给出后续多个 token,再交给主模型并行验证。官方模型卡给出的设计是一次前向预测后续 7 个 token。

SWA、Sparse MoE 和 MTP 放在一起看,就能看出 MiMo-V2.6 架构上的取舍:大容量负责装下能力,稀疏计算和局部注意力控制每一步的代价,推测解码则继续提高生成速度。

当单条轨迹能够以更低成本持续生成,RL 才有空间把 rollout 的数量推上去。而到了 MiMo-V2.6 这种一次更新就产生两万多条轨迹的规模,计算压力开始从模型内部蔓延到整个训练系统。


02


RL 开始像分布式生产系统

1568 个 prompt,每个采样 16 条 rollout,一次更新对应 25088 条 trajectory。困难之处在于,这 25088 条轨迹不会按照统一节奏结束。

有的代码任务几轮操作就找到问题,有的会不断运行测试、读取报错再重新修改;网络安全任务可能经历多次环境验证,视觉 Agent 又有不同的执行链路。轨迹长度、工具延迟和环境响应混在一起以后,一个 batch 内部很容易出现明显的长尾。

如果继续采用严格同步方式,已经完成任务的计算资源需要等待少数仍在运行的轨迹。规模越大,这种等待造成的资源浪费越明显。

MiMo-V2.6 用 fully asynchronous GRPO,把 rollout、环境执行、grader 和模型更新拆开运行。生成侧完成一条轨迹后可以继续领取任务,环境执行与评分各自推进,训练侧消费已经准备好的数据,不再要求一整个 batch 同时跨过每个阶段。

这种变化看起来属于工程优化,却直接影响了小米怎样组织 RL 数据。

MiMo-V2.6 没有为代码、通用 Agent、视觉和网络安全分别训练一套独立策略,而是把多领域任务以及不同 Agent harness 混入同一次 RL,小米将其称为 You Only RL Once。


原因在于这些任务虽然环境不同,内部却共享大量决策结构。模型需要判断当前状态缺什么信息、该调用哪个工具、执行结果是否符合预期、失败以后应该继续搜索还是修改方案。多个领域一起训练,这些行为策略可以直接在同一个 policy 中发生迁移。

多个 harness 的作用则更隐蔽。不同框架会改变 system prompt、工具定义和上下文组织方式,模型反复面对不同交互外壳后,就更难把某一种固定接口当成解题捷径。训练压力逐渐落到状态理解、工具选择和环境反馈这些更底层的能力上。


走到这里,Agent RL 的瓶颈已经发生了一次变化。模型能够比较高效地产生长轨迹,异步系统也能够持续吞吐不同环境,真正稀缺的东西开始变成轨迹里的有效反馈。

因为 25088 条 trajectory 并不天然等于 25088 份高质量训练信号。

03


从 GRS、GAR 到 MOPD2

传统可验证 RL 很依赖 binary reward。代码通过测试得到正向奖励,失败则没有。对于短任务,这种反馈已经足够清晰,但放进几十步甚至更长的 Agent 轨迹以后,大量过程差异会被压成同一个数字。

假设同一道任务生成 16 条 rollout,其中 5 条通过测试。一条可能快速定位根因,只修改必要代码。另一条经历大量无效搜索,还有一条虽然通过测试,却引入许多额外修改。只看 pass / fail,这几条成功轨迹很难拉开差距。

MiMo-V2.6 因此把 grader 从结果检查器进一步变成组内比较器。

GRS,也就是 Groupwise Reward Synthesis,会同时观察同一道任务产生的多条 rollout,从它们之间已经出现的差异中构造 task-specific rubric,再把过程质量与测试结果结合起来。评价标准因此会随着当前 policy 实际暴露出来的问题发生变化。

GAR(Groupwise Advantage Redistribution)则进一步影响策略更新。即使几条 trajectory 全部完成任务,grader 仍会继续比较它们,再把更多 advantage 分配给质量较高的方案。

官方也明确提到,这套过程会结合环境加固、异常筛查和 verifier cross-check 来处理 reward hacking。这里带来的变化很直接:RL 的计算投入不再只用来制造更多样本,还开始投入到理解样本。


当 rollout 数量已经很大时,再增加一批只有 0 和 1 的轨迹,信息增量可能有限,grader 如果能够继续拆出成功方案之间的质量差异,同样一轮环境交互便能产生更丰富的梯度信号。

可验证任务能够依赖这一套机制,开放式 Agent 却还有另一类困难。很多任务缺少稳定的自动 verifier,即使模型完成了一段复杂操作,也很难仅靠环境给出可靠评分。

MiMo-V2.6 在混合 RL 之后又加入 MOPD2,也就是 Multi-Prefix Multi-Teacher On-Policy Distillation。它会复用 Teacher trajectory 和 SFT demonstration 中已经存在的历史,把轨迹截取到某个中间状态,再让学生从这里继续 rollout。

假设一条 Agent 任务需要 40 步才能到达关键决策位置,训练这个位置时就不必反复生成前面 39 步。历史状态可以直接作为 prefix,训练资源集中到后续决策,同时一条教师轨迹还能提供多个可复用的训练起点。

GRS 和 GAR 解决的是可验证任务中反馈过粗的问题,MOPD2 则把高质量教师轨迹中的决策信息带进难以自动评分的区域。

MiMo-V2.6 也因此把 RL 的扩张从 rollout 数量继续推进到了反馈密度和轨迹复用。

04


Agent RL 正在从算法变成系统工程

MiMo-V2.6 给出的信号,其实已经超出了某一种 RL 算法本身。

Agent 进入真实环境以后,训练数据不再只有静态 token,还多出了状态、工具调用、执行结果、错误反馈和连续决策。模型需要亲自走过这些过程,才能产生一条能够用于强化学习的 trajectory。

这也让后训练的竞争维度发生了扩展。模型架构要能够承受长时间生成,分布式系统要持续运行大量异步环境,grader 要从成功轨迹中进一步拆出质量差异,教师轨迹还要被复用到难以自动验证的任务里。

MiMo-V2.6 依然运行在人设计的任务、环境、评分机制和训练框架内,但它展示出一种很清晰的方向:Agent 能力提升越来越依赖整个训练闭环的吞吐和反馈质量。

参数继续扩大当然还有价值,只是到了 Agent 阶段,另一个变量已经越来越难忽略 —— 一套训练系统能够生产多少有价值的行为轨迹,又能从这些轨迹里转化出多少有效的学习信号。

MiMo-V2.6 的技术意义,更多就落在这里。

参考链接: https://mimo.xiaomi.com/zh/mimo-v2-6

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
郑州市人大常委会公布最新人事任免

郑州市人大常委会公布最新人事任免

郑州新闻广播
2026-09-22 13:46:21
玄学提醒:如果一个人还在穿着10年前的衣服,只说明几个问题

玄学提醒:如果一个人还在穿着10年前的衣服,只说明几个问题

木言观
2026-08-01 13:58:35
技术复盘13岁于子迪打破亚洲纪录:超强的无氧能力 独有的换气方式

技术复盘13岁于子迪打破亚洲纪录:超强的无氧能力 独有的换气方式

林子说事
2026-09-22 03:20:27
脱光诱惑池昌旭!《挑情丑闻》26岁女星私照曝 网惊:172cm逆天长腿

脱光诱惑池昌旭!《挑情丑闻》26岁女星私照曝 网惊:172cm逆天长腿

ETtoday星光云
2026-09-22 13:39:03
亚运会奖牌榜排行:日本32枚,韩国23枚,中国代表团太让国人骄傲

亚运会奖牌榜排行:日本32枚,韩国23枚,中国代表团太让国人骄傲

林子说事
2026-09-22 13:37:27
台海第1枪打响后,解放军全力收台,96个小时内就能结束战斗?

台海第1枪打响后,解放军全力收台,96个小时内就能结束战斗?

阿芒娱乐说
2026-09-22 20:10:23
吉隆泥石流灾害遇难人员身份识别工作已开展 目前已确认部分遇难人员身份

吉隆泥石流灾害遇难人员身份识别工作已开展 目前已确认部分遇难人员身份

每日经济新闻
2026-09-22 22:54:12
马拉多纳生命最后时刻:对侄子留下最后一句遗言,下葬时心脏被摘除

马拉多纳生命最后时刻:对侄子留下最后一句遗言,下葬时心脏被摘除

历史甄有趣
2026-09-20 12:20:17
把华为请下主桌,长安汽车不给600亿自研留退路

把华为请下主桌,长安汽车不给600亿自研留退路

ZAKER新闻
2026-09-22 14:18:09
普京时代即将步入倒计时,中国必须警惕俄罗斯政策突变!

普京时代即将步入倒计时,中国必须警惕俄罗斯政策突变!

果妈聊娱乐
2026-09-21 09:47:37
五常爆发激烈冲突?联合国秘书长开选,亲华候选人被迫提前退场

五常爆发激烈冲突?联合国秘书长开选,亲华候选人被迫提前退场

观锐器
2026-09-21 11:55:37
卖一台iPhoneDuo,中国收税1847,iPhone18 Pro的税是1157

卖一台iPhoneDuo,中国收税1847,iPhone18 Pro的税是1157

互联网.乱侃秀
2026-09-22 10:18:49
印媒扬言,如巴基斯坦敢买中国歼-35,印度会先将其炸毁在机场

印媒扬言,如巴基斯坦敢买中国歼-35,印度会先将其炸毁在机场

流年恰似繁花汐
2026-08-21 16:17:39
退休人员注意:养老金认证改了,超期没做会影响养老金发放

退休人员注意:养老金认证改了,超期没做会影响养老金发放

你在偷看谁
2026-09-22 21:09:41
东营市东营港经济开发区建设交通局一级主办张伟接受纪律审查和监察调查

东营市东营港经济开发区建设交通局一级主办张伟接受纪律审查和监察调查

闪电新闻
2026-09-22 20:47:59
上海街头一幕被狂赞!全程近3分钟,所有车辆集体停下静静等候,无人鸣笛

上海街头一幕被狂赞!全程近3分钟,所有车辆集体停下静静等候,无人鸣笛

新民晚报
2026-09-22 13:45:46
王奥芊成亚运奇兵!张籽萱回归盘活全队,为何泰国要比日本难打?

王奥芊成亚运奇兵!张籽萱回归盘活全队,为何泰国要比日本难打?

排球黄金眼
2026-09-22 23:22:23
许家印为何骗不了李嘉诚——

许家印为何骗不了李嘉诚——

跟着老李看世界
2026-09-11 13:37:21
一觉醒来,中国油轮在波斯湾遇袭!这不是误炸,是有人想“破窗”

一觉醒来,中国油轮在波斯湾遇袭!这不是误炸,是有人想“破窗”

闫树军论评
2026-05-08 18:11:21
一胖毁所有!蒙嘉慧出席活动,和昔日判若两人!坦言节食还会发胖

一胖毁所有!蒙嘉慧出席活动,和昔日判若两人!坦言节食还会发胖

娱乐团长
2026-09-21 20:18:21
2026-09-23 00:12:49
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7665文章数 20785关注度
往期回顾 全部

科技要闻

OPPO Find X10:ColorOs 17比参数更值得聊

头条要闻

女子手臂被带刺"球"砸中扎20根刺 三家医院都处理不了

头条要闻

女子手臂被带刺"球"砸中扎20根刺 三家医院都处理不了

体育要闻

奖牌榜:中国单日再夺9金 合计32金13银8铜

娱乐要闻

曝王玉雯杨玏结婚又离婚

财经要闻

中国太空算力的来龙去脉 这篇文章讲透了

汽车要闻

东风日产新N7上市限时权益价10.99万起 实现33项升级

态度原创

本地
时尚
亲子
公开课
军事航空

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

女人不管多大年纪,一年四季都可以穿衬衫,大方得体又高级

亲子要闻

幼儿园的食品安全,容不得“拖延”两个半月

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

特朗普被指下令空袭胡塞武装后变卦 最后一刻叫停

无障碍浏览 进入关怀版