网易首页 > 网易号 > 正文 申请入驻

罗福莉沉寂半年官宣小米强化学习!直播新模型训练过程,一小时烧3万美元

0
分享至

梦晨 发自 凹非寺
量子位 | 公众号 QbitAI

什么情况?小米新模型的强化学习训练,直接开了现场直播。

点进去一看,这哪是训练现场啊,这就是烧钱现场,一眨眼就是10美刀,一分钟就是4000多元人民币出去了。



当然烧钱的速度可能不是均匀的,从pro模型开始训练算起36小时,两款模型已经花了超过108万美元,平均每小时3万美元

要是别人干这事得喊一句误闯天家,但是小米干这事只能喊一句误闯米家了。

在这个页面上,训练花了多少钱、跑了多少步、奖励曲线涨没涨、哪个节点的显卡出了故障,全部公开可查。



见过开放权重、开放训练代码和开放训练数据的,开放训练过程的还真是没见过,围观群众纷纷大呼过瘾。





那么目前MiMo-V2.6的Flash和Pro两款模型训练得怎么样了?

其实还在初期,毕竟刚开始训练1天多一点。

不过已经能看出两者在RL过程中都有了比较明显的能力提升:

Pro的dynsam/avg@n从第1步的约0.565提升至0.614,Flash则从约0.514提升至0.603;最新公开的DeepSWE v1.1离线评测中,Pro和Flash分别达到62.24和60.77。(对比DeepSeek-Flash v1.1是74.2%)

Flash从更低的起点快速追近,Pro目前只保持小幅领先。不过Pro训练完一个Step更慢,所以最新的评分还没出来。



自4月份开源MiMo-v2.5后,小米沉默了近半年。

现在负责人罗福莉出来解释,这期间只研究了一件事:强化学习能扩展到多远



小米公开如何Scaling强化学习

传统的预训练scaling很容易理解:更多数据 × 更多参数 × 更多算力 → 更强模型

现在前沿模型越来越关注RL能不能也这样scaling?

也就说如果持续增加:

每轮生成多少轨迹;

模型面对多少种真实任务环境;

为判断这些轨迹好不好投入多少计算;

模型能力是否还能持续提高?

小米给出的答案是沿三个维度扩展:训练计算量、环境/执行框架、评分计算量。

###训练计算量的Scaling

第一个维度最直观,就是把RL本身的计算规模做大。

MiMo-V2.6系列每个训练Step大约会处理20亿Token,配置为1568个Prompt × 每个Prompt 16条Rollout

也就是说,同一道题并不是只让模型回答一次,而是让它尝试多条不同的解题和行动轨迹,再从这些尝试中获得强化学习信号。

1568×16意味着一轮就可能产生超过2.5万条Rollout。而对于Agent任务来说,一条Rollout又远不只是“一问一答”:模型可能要经历几十轮思考、工具调用、环境反馈和再次行动,因此最终一个Step的Token数可以达到数十亿级别。



更重要的是,整个系统采用了Fully Async,也就是完全异步的执行方式

传统意义上可以把一次RL训练想象成一条整齐的流水线:先把所有样本生成完,再统一评分,然后训练模型,最后开始下一轮。

但大规模Agent RL很难这样等待。

在MiMo的系统里,不同任务可以同时处于不同阶段:有的Agent还在环境中执行任务,有的已经完成、等待判分,有的正在计算Reward,还有新的任务正在进入系统。生成、执行、评分和训练不再严格排队,而是组成了一套持续运转的异步流水线。



环境的Scaling

第二个扩展方向是Environments and Harnesses,也就是训练环境和执行框架的扩展

MiMo-V2.6做的是Multi-task Agentic RL:代码、通用任务、视觉、Chat等不同类型的任务,可以被混合到同一次RL Run中训练,而且这些任务还可以运行在不同的Harness里。

例如一个编程Agent的Harness可能允许模型打开终端、修改代码、执行测试、阅读报错,然后继续修改;另一个视觉Agent面对的则可能是一套完全不同的工具、环境反馈和成功条件。

因此,MiMo想扩展的除了“题目数量”,还有模型能够进入多少种环境、使用多少种工具、解决多少种类型的问题

这也是为什么直播页面会专门展示Batch Composition:这一栏实际上是在告诉外界,每一个训练Step中,模型正在从什么样的任务和环境里获取经验。



评分的Scaling

第三个Scaling方向则更容易被忽略:Grader Compute,也就是给打分本身增加算力。

强化学习需要奖励,但复杂Agent任务的奖励 并不像数学选择题那样容易得到。

代码任务还可以运行Test Case:100个测试通过了多少个,就可以形成相对客观的反馈。

但面对更开放的Agent任务,仅仅判断“最终成功还是失败”往往远远不够,负责判断模型做得好不好的评分者,同样开始消耗越来越多计算资源。

而这里还有一个更加关键的问题Credit Assignment,也就是信用分配。

假设一个Agent为了完成任务连续执行了40步:搜索资料、打开网页、阅读信息、编写代码、运行测试、发现错误、修改代码,最终成功完成任务。

如果系统最后只告诉模型一句“成功,Reward=1”,这个学习信号其实非常粗糙。

因为模型并不知道:前面的40步中,究竟哪些动作真正帮助了成功?哪些步骤其实毫无必要?哪一次修改扭转了整个任务?又有哪些动作虽然最后没有导致失败,却实际上是不好的选择?

MiMo在这次训练中特别提到了Agentic In-group Credit Assignment。目前还没有公布具体算法,但结合“同一个Prompt生成16条Rollout”的训练方式,可以理解其基本目标:利用同组多条Agent轨迹及其结果,获得比简单的最终成败更加细致的强化学习信号。

同一组任务尝试,哪些行为应该获得更多鼓励、哪些应该减少鼓励,以及如何把这种判断转成训练信号。



这样一来,MiMo所说的三个Scaling方向实际上构成了一套完整体系:

扩展计算量,让模型产生更多经验;扩展环境和Harness,让模型获得更加多样的经验;更多评分计算量,则负责从这些海量经验中提取更加准确的学习信号。

当预训练的Scaling已经发展多年之后,能否把模型与环境交互、产生经验、评价经验再到学习经验的整个RL循环,也变成一台可以持续扩大规模的机器?

不过前来围观的大佬ViT大佬给出更直接的翻译:三件事,背后都是算力。



参考链接
[1] https://mimo.xiaomi.com/rl
[2]https://x.com/_LuoFuli/status/2100296686719610932

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
浙江商K大面积关门:今年第一批“回家过年的人”出现了

浙江商K大面积关门:今年第一批“回家过年的人”出现了

News脑洞
2026-09-20 19:04:32
国庆假期调休今天要上班!苹果用户感慨:iPhone闹钟终于会响了

国庆假期调休今天要上班!苹果用户感慨:iPhone闹钟终于会响了

快科技
2026-09-20 09:43:10
浙江省金华市原副市长郑余良接受审查调查

浙江省金华市原副市长郑余良接受审查调查

界面新闻
2026-09-20 18:05:36
国务院任免国家工作人员

国务院任免国家工作人员

新华社
2026-09-20 17:35:03
成都理工大学名誉校长刘宝珺逝世,享年96岁

成都理工大学名誉校长刘宝珺逝世,享年96岁

界面新闻
2026-09-20 14:18:33
“秦始皇陵为什么不挖”冲上热搜,文物修复专家:贸然打开冲击很大,没必要动,要对天地、对自然有敬畏之心

“秦始皇陵为什么不挖”冲上热搜,文物修复专家:贸然打开冲击很大,没必要动,要对天地、对自然有敬畏之心

极目新闻
2026-09-20 14:12:54
他身上没有一滴中国血,却把一辈子活成了中国人,给中国捐了4亿元!

他身上没有一滴中国血,却把一辈子活成了中国人,给中国捐了4亿元!

文史达观
2026-09-20 06:45:28
兵败如山倒!国产新能源或已证明:中国其实不需要二线豪华品牌

兵败如山倒!国产新能源或已证明:中国其实不需要二线豪华品牌

铭记历史呀
2026-09-20 16:15:46
中国勺子在瑞典被当场销毁:甲醛超标2倍!网友:国内市场怎么办

中国勺子在瑞典被当场销毁:甲醛超标2倍!网友:国内市场怎么办

步论天下事
2026-09-19 10:30:13
太猛了!中国1小时连夺3金,打破世界纪录+16岁杜雨宸一战成名

太猛了!中国1小时连夺3金,打破世界纪录+16岁杜雨宸一战成名

林小湜体育频道
2026-09-20 14:24:21
亚运会:国乒女团出线!孙颖莎轰11-1胜朱雨玲连砍2分,王曼昱输球、蒯曼速胜

亚运会:国乒女团出线!孙颖莎轰11-1胜朱雨玲连砍2分,王曼昱输球、蒯曼速胜

全言作品
2026-09-20 16:50:02
密密麻麻!33岁女子体内取出197枚,医生:从医以来第一次见

密密麻麻!33岁女子体内取出197枚,医生:从医以来第一次见

上海约饭局
2026-09-19 10:42:08
李成钢任中华人民共和国国际贸易谈判代表(正部长级)

李成钢任中华人民共和国国际贸易谈判代表(正部长级)

新京报
2026-09-20 16:27:07
辽宁跑圈“大神”赵亮去世,年仅43岁,每天坚持跑步,好友曝原因

辽宁跑圈“大神”赵亮去世,年仅43岁,每天坚持跑步,好友曝原因

寒士之言本尊
2026-09-19 20:19:47
低空经济亡于2026

低空经济亡于2026

凤眼论
2026-09-20 15:24:34
悲催!哈工大本科毕业,40岁失业四五年,自述彻底输了,无业无妻无后且存款微薄,看着父母生活艰辛,评论区吵翻

悲催!哈工大本科毕业,40岁失业四五年,自述彻底输了,无业无妻无后且存款微薄,看着父母生活艰辛,评论区吵翻

火山詩话
2026-09-20 07:48:20
湖北宜都:日发万罐鱼子酱背后的渔业“上岸”故事|活力中国调研行

湖北宜都:日发万罐鱼子酱背后的渔业“上岸”故事|活力中国调研行

财联社
2026-09-20 10:17:08
亚运游泳首日综述:中国队6金1银2铜,破4项赛会纪录,潘展乐夺金

亚运游泳首日综述:中国队6金1银2铜,破4项赛会纪录,潘展乐夺金

乒烧泳球
2026-09-20 18:18:32
大风追踪 | 官方通报“焚烧一平米杂草要罚500元”:未对该村民作出罚款决定,具体情况正进一步核查

大风追踪 | 官方通报“焚烧一平米杂草要罚500元”:未对该村民作出罚款决定,具体情况正进一步核查

大风新闻
2026-09-19 15:19:04
北大、复旦校长,接连发出警告

北大、复旦校长,接连发出警告

中国新闻周刊
2026-09-19 11:03:23
2026-09-20 20:12:49
量子位 incentive-icons
量子位
追踪人工智能动态
13362文章数 176568关注度
往期回顾 全部

科技要闻

谷歌承认:AI模型“黑”进3家公司

头条要闻

"失独"母亲58岁生子60岁再诞一女:希望孩子能有个伴

头条要闻

"失独"母亲58岁生子60岁再诞一女:希望孩子能有个伴

体育要闻

游泳2小时6金!亚运金牌榜:中国11金领跑

娱乐要闻

许嵩刚官宣结婚,冯禧黑历史就被扒

财经要闻

民企土地 被政府"无偿收储"后转手卖7亿

汽车要闻

FREELANDER神行者8开启交付 首批新车正式交付用户

态度原创

房产
旅游
亲子
教育
公开课

房产要闻

荒了18年!海口豪宅,要重启了!

旅游要闻

2026天下第一泉风景区中秋国庆游园会即将启幕

亲子要闻

十件事看透孩子的心理!

教育要闻

科学老师用塑料桶“手搓”出4米高的水火箭。网友:“科学点燃梦想”具象化了!(来源:人民日报

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版