网易首页 > 网易号 > 正文 申请入驻

小米MiMo-V2.6技术报告公开,以大规模RL迈向RSI!

0
分享至

智猩猩AI整理

编辑:金水

今天,小米 LLM-Core 团队公开了 MiMo-V2.6 系列技术报告,并同步开源了模型权重、RL 框架、多域任务环境与轻量蒸馏模型。


  • 论文题目:

    MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement

随着技术报告公开,这个模型的真正看点也逐渐清晰,1.02T 参数的 Pro 与 310B 参数的 Flash,两个 MoE 模型,已经把 Agent 能力推到了与 Claude Opus 5、GPT-5.6 同台竞争的位置。

报告的副标题很直白,Scaling Reinforcement Learning Towards Self-Improvement(把强化学习推向自我提升),一份把"RL scaling"写进标题的报告。

它的开篇逻辑是:递归自我提升(RSI)需要 agent 把模型和环境耦合起来,持续提供多步轨迹和反馈信号;

而要在基础模型上 scale RL,卡点在于两件事,模型架构得留出足够大的探索空间,以及 scale RL 需要一整套基础设施、环境与评分器的工程解法。

于是 MiMo-V2.6 的全部后训练改动,几乎都围绕这一个目标展开:把 RL 算力沿训练、环境、评分三个维度一起推上去。

最终的提升效果相当直接,在代码 Agent 基准 DeepSWE v1.1 上,Pro 经 RL 后从 58.4 爬到 72.6,Flash 从 48.7 爬到 65.7;

横向摆到前沿模型桌上,Pro 在 Terminal-Bench 2.1、AutomationBench、MiMo Visual Coding 上已经反超 Claude Opus 5。


01

模型架构:

hybrid-SWA MoE 主干

MiMo-V2.6 是一个全模态 MoE 模型,文本主干由重复的 hybrid block 堆叠而成,每个 block 里交替排布局部滑动窗口注意力(SWA)和全局注意力(GA),滑动窗口大小只有 128。


具体的体量不对称很夸张,Pro 共 70 层(60 层 SWA + 10 层 GA)、384 个专家每次激活 8 个、总参数 1.02T、激活 42B;

Flash 共 48 层、256 个专家激活 8 个、总参数 310B、激活 15B。视觉侧挂着 681M 的 MiMo-ViT,音频侧挂着 Audio Tokenizer(308M)与 Audio Patch Encoder(127M)。



支撑多模态与高效率的还有几块独立模块:

(1)MiMo-ViT 用 sink-augmented SWA 替代固定窗口注意力,让信息能跨窗口边界流动,缓解视觉碎片化;

(2)Audio Encoder 分两阶段,先用 Audio Tokenizer 把语音压成 20 个 RVQ 码本、再经开残差量化的 patch encoder,把音频序列率从 25Hz 降到 6.25Hz;

(3)Speculative Decoder 基于 DFlash 的块扩散设计,用 5 层稠密 FFN 的 drafter 单次前向预测 7 个后续 token,做并行校验加速解码。

报告称,这套 hybrid-SWA 主干在不牺牲长程理解的前提下大幅压低了长序列的计算与 KV 成本,也为后面"在环境里跑几百轮 rollout"留出了算力空间。

02

预训练与 mid-training:

为 RL 铺路

预训练语料横跨文本、视觉与音频。

文本来自网页、书籍、论文、代码与 STEM;视觉覆盖图像描述、定位、OCR、GUI、视频与视觉编程;音频按语音-文本交错、ASR、通用音频描述三类组织。

训练分两阶段,先在纯文本上打基础,再接自研 ViT 与音频编码器做全模态联合训练。上下文从 32K 一路扩到 256K,Flash 训了 48T token、Pro 训了 30T token。

真正为大规模 RL 铺路的是mid-training。

这一阶段转成 agent-centric,用覆盖代码、通用、视觉、科研的真实 agent 轨迹把探索空间撑大,上下文进一步拉到 1M。两个关键改动:

(1)优化器从 AdamW 切到 Muown(Muon 的变体,带显式行范数控制),专门扛大 batch 训练下的数据效率,且全程无 loss spike;

(2)引入 MXFP4 量化感知训练(QAT),让模型提前适应低精度计算,RL 阶段直接沿用 FP32 主权重与 Muown 行状态初始化,稳住低精度训练。

03

Scaling RL:

沿三个维度堆算力

报告在 scaling 章节就有介绍,先做一轮很短的监督微调(SFT),之后就全力 scale RL,不再反复回炉,他们把这种哲学叫"You Only RL Once"。

RL 算法本身沿用成熟的 GRPO,配合异步 partial rollout(staleness 为 4)和 prompt-mean 聚合;真正的创新,落在更细的评分信号和一整套支撑大规模 agentic RL 的基础设施上。

所有实质变化可以归到三个维度。

第一是训练算力。单次 run 横跨数千张 GPU,Pro 和 Flash 的 RL 后训练分别烧了 260 万和 90 万美元。

每个 step 用 1568 个 prompt、每组 16 条 rollout,等于每步跑出 2.5 万条序列、2.7B~~3.7B 个 token,单条序列约 11 万~~15 万 token,上下文最长到 1M。

第二是环境与 harness。任务覆盖代码(68%)、通用工具使用(12%)、美学设计(13%)、上下文遵循(3%)与网络安全(4%)五大域;

并刻意训练多种 mini-harness,逼模型学到可迁移的解题策略,而不是绑定某一种交互框架。

报告专门用 hack agent 反复试探环境、再用离线轨迹审计兜住奖励作弊,整个 RL 过程中确认作弊的轨迹占比始终压在 2% 以下。

第三是评分算力。这就是 MiMo 在报告里最硬的一块创新,群组智能评分(Groupwise Agentic Grading),不再只靠"测试过就 1 分、不过 0 分"的二元奖励:


(1)GRS(群组奖励合成,离线):收集多条 rollout 让 agent 对比学出"实现 rubrics"和"行为 rubrics",最终奖励是 `R = R测试 × S实现 × S行为`,同分之间也能按质量拉开差距;

(2)GAR(群组优势重分配,在线):在"有对有错"的组内横向比较,把正优势从低质量的解往高质量的解上重新分配;

(3)配套的长度惩罚与段落级行为惩罚,专门压住 RL 中 token 暴涨和格式/工具调用错误。

钱花在哪,报告也摊开讲了,以 Pro 为例,rollout 占 43.8%、训练 43.5%、grader 12.7%,光"让模型去环境里干活"和"真正更新模型"就吃掉近九成算力。

04

实验评估

把 MiMo-V2.6 摆到与前沿模型同一张桌子上,差距已经很小,但分布并不均匀,报告本身也承认了这一点。

在智能体方向,它确实追到了前沿:DeepSWE v1.1 拿到 71.9(Claude Opus 5 为 74.0、GPT-5.6 为 73.0);Terminal-Bench 2.1 为 89.9,已超过 Claude Opus 5 的 89.1;AutomationBench 53.1,超过 Claude Opus 5 的 50.3;



视觉侧 MiMo Visual Coding 72.3,同样超过 Claude Opus 5 的 70.0;网络安全侧 CyberGym 为 94.0、Flash 更到 95.1,竞品未披露成绩。

在 Reasoning 与 Agentic 共二十余项指标上,MiMo-V2.6 与 Claude Opus 5、GPT-5.6、Claude Fable 5 互有胜负。

相对上一代 MiMo-V2.5-Pro(DeepSWE 仅 19.0),这一代是断崖式跃升,且跨域普遍成立。

但短板也明确Terminal-Bench 4.0(Pro 34.9 vs 49.0)、ExploitBench(47.9 vs 70.0)、ExploitGym(17.8 vs 22.1)等"科学导向"或复杂利用类任务上,Claude Opus 5 仍明显领先。

报告也主动标注了架构改动带来的鲁棒性边界,MoE 在 RL 阶段若不冻结 router,会出现严重负载崩塌,专家负载变异系数(CV)从 0.78 涨到 2.0,峰值负载从 6 倍飙到 16 倍,冷门专家占比从 0.5% 涨到 22%;

小米因此冻结 router,三个指标全程平稳(CV≈0.7、峰值≈5.5 倍、冷专家≈1%)。

为保证训练-推理一致,他们还用 R3(Rollout Routing Replay)重放每条 token 在各 MoE 层选的专家,配合 top-p 候选集重放。

05

MOPD2、开源与自我提升之路

报告还用 MOPD2(Multi-Prefix Multi-Teacher On-Policy Distillation)把不同任务上训出的教师模型能力合流,覆盖那些难以设计可靠 RL 奖励的领域,例如长程游戏开发、科研、具身智能等。

对社区,小米开源了一整套 agentic RL 基座:轻量模型 MiMo-V2.6-Distill-Qwen-9B(在 Qwen3.5-9B 上用 MiMo 生成数据做 SFT,再走多 harness RL,在 21 项 harness 评测上全数超过原版)、多域带 verifier 的任务环境、端到端 RL 框架,以及可组合的 mini-harness。

在 9B 蒸馏模型上,RL 同样能在多种 harness 下稳定带来增益。

报告在结论里点明,MiMo-V2.6 真正拉开差距的,是针对长程 Agent 任务的大规模 RL 后训练,以及围绕"细粒度奖励、稳定路由"做出的一整套机制改造。

模型能力的天花板,已经越来越取决于后训练阶段对真实执行过程的学习,这条路正是它通向递归自我提升的起点。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
事态升级!蔡康永为“台独”站台遭品牌切割,过往争议被扒彻底凉凉

事态升级!蔡康永为“台独”站台遭品牌切割,过往争议被扒彻底凉凉

萌神木木
2026-10-05 01:36:43
浙江体育局副局长朱启南:小孩姐和严子怡都是校园体育发掘

浙江体育局副局长朱启南:小孩姐和严子怡都是校园体育发掘

懂球帝
2026-10-04 21:21:28
沈伯洋台北市竞选总部成立 艺人蔡康永低调现身会场力挺

沈伯洋台北市竞选总部成立 艺人蔡康永低调现身会场力挺

金牛传声
2026-10-04 16:11:41
后续!空姐下跪闹事当事人身份终于浮出水面!涉事人员欧某某被官方点名,这下要为自己的嚣张行为付出代价了

后续!空姐下跪闹事当事人身份终于浮出水面!涉事人员欧某某被官方点名,这下要为自己的嚣张行为付出代价了

静若梨花
2026-10-04 15:50:33
中国宣布:对巴西牛肉加税55%!10月1日就生效!到底发生了什么?

中国宣布:对巴西牛肉加税55%!10月1日就生效!到底发生了什么?

相思赋予谁a
2026-10-04 15:36:30
外媒称十几名中国人加入乌克兰部队?充当无人机飞手

外媒称十几名中国人加入乌克兰部队?充当无人机飞手

项鹏飞
2026-10-04 20:11:18
香港过亿豪宅被曝偷工减料,部分位置钢筋少约41%-75%,屋宇署约见开发商

香港过亿豪宅被曝偷工减料,部分位置钢筋少约41%-75%,屋宇署约见开发商

爆角追踪
2026-10-04 18:21:21
啪啪打脸!上海同学聚会一顿吃掉46888元,众人认定组局人必须请客,结果18人起诉被驳回

啪啪打脸!上海同学聚会一顿吃掉46888元,众人认定组局人必须请客,结果18人起诉被驳回

火山詩话
2026-10-04 11:18:18
牡丹花下死!管不住“下半身”的张本智和,终为自己的荒唐买了单

牡丹花下死!管不住“下半身”的张本智和,终为自己的荒唐买了单

心灵得以滋养
2026-10-02 18:07:21
俄政府:2026年俄罗斯天然气对华平均价格将为每千立方米247.9美元

俄政府:2026年俄罗斯天然气对华平均价格将为每千立方米247.9美元

俄罗斯卫星通讯社
2026-10-04 16:08:56
亚运MVP官宣:百米飞人汶颂+13岁于子迪当选 7金王张展硕落选

亚运MVP官宣:百米飞人汶颂+13岁于子迪当选 7金王张展硕落选

醉卧浮生
2026-10-04 11:21:32
卢卡申科:白俄罗斯将在对乌克兰的冲突中无条件地与俄罗斯保持一致

卢卡申科:白俄罗斯将在对乌克兰的冲突中无条件地与俄罗斯保持一致

阿尔卑斯瞭望
2026-10-04 19:54:39
随着吴宜泽10-5夺冠,最新世界排名:前2都是中国人,丁俊晖第15

随着吴宜泽10-5夺冠,最新世界排名:前2都是中国人,丁俊晖第15

球场没跑道
2026-10-04 22:44:30
10万游客涌入5万人口的青海祁连县城致酒店满房,当地紧急安排免费宿舍,游客:-4℃住进暖气房,祁连上大分!

10万游客涌入5万人口的青海祁连县城致酒店满房,当地紧急安排免费宿舍,游客:-4℃住进暖气房,祁连上大分!

极目新闻
2026-10-04 17:31:17
真的辣眼睛!苦命的鸳鸯,在田野里的私会,却是最美的风景吗

真的辣眼睛!苦命的鸳鸯,在田野里的私会,却是最美的风景吗

史海流年号
2026-10-03 15:16:56
快讯!“台独”分子赖清德发表声明了!

快讯!“台独”分子赖清德发表声明了!

做个平凡的轩友
2026-10-04 16:48:27
NBA哪些球队拥有两位全明星却没能打进季后赛?近40年共七支

NBA哪些球队拥有两位全明星却没能打进季后赛?近40年共七支

陌识
2026-10-03 13:16:12
何超琼遭骚扰恐吓,还被勒索2000万港币,获批禁制令......她曾说豪门没有理所当然的机会,也要去争取

何超琼遭骚扰恐吓,还被勒索2000万港币,获批禁制令......她曾说豪门没有理所当然的机会,也要去争取

新民周刊
2026-10-04 15:33:49
中网再爆大冷门!萨巴伦卡遭20岁新星横扫,前2号种子均已遭淘汰

中网再爆大冷门!萨巴伦卡遭20岁新星横扫,前2号种子均已遭淘汰

全景体育V
2026-10-04 12:51:13
蔡康永为台独分子站台,现场挥舞应援棒,合作商火速下架他的内容

蔡康永为台独分子站台,现场挥舞应援棒,合作商火速下架他的内容

芊手若
2026-10-04 23:49:49
2026-10-05 04:56:49
智猩猩
智猩猩
AI 技术内容与服务平台
187文章数 9关注度
往期回顾 全部

科技要闻

苹果确认:iPhone 18 Pro Max有问题

头条要闻

30多岁中国夫妇在澳洲遇惨烈车祸丧生 肇事司机仅17岁

头条要闻

30多岁中国夫妇在澳洲遇惨烈车祸丧生 肇事司机仅17岁

体育要闻

32胜0负!德约2-1逆转头号种子兹维列夫 第7次晋级中网四强

娱乐要闻

高晓松悄悄复出:官媒没给他留体面

财经要闻

OpenAI前安全部门员工:公司文化已崩坏

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

游戏
本地
旅游
亲子
数码

《战争机器》新作恐怖感拉满!怪物直扑玩家脸

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

旅游要闻

又是为了流量的造谣抹黑!官方通报“阿尔山景区二百一晚的大酒店”

亲子要闻

孩子流感要吃奥司他韦吗?抗病毒药用药时机、年龄与疗程全解

数码要闻

联想推出Lenovo Watch Fit 3智能手表,199元

无障碍浏览 进入关怀版