小米把两场模型后训练搬上了直播。正在跑的是 mimo-v2.6-pro 和 flash 两个模型的 Agentic RL 后训练,训练过程对外实时可见。
有作者根据直播画面推算,这套训练每秒大约烧掉 10 美元。这个数字来自对直播内容的估算,不是官方口径。
![]()
分数摆在明面上
直播里给出的一个关键指标是 DeepSWE 得分。mimo-v2.6-pro 拿到 62,对比之下,DeepSeek-v4.1-flash 的同一项得分是 74.2。
差距接近 12 分。不过素材同时说明,mimo-v2.6-pro 仍处在训练早期,这个分数并非终态。
为什么值得看
把后训练过程直播出来,本身就把两件事同时暴露了:一是每秒约 10 美元的算力开销,二是模型在训练中途的真实分数。62 对 74.2 的对比,是训练早期的一个切片,不是结论。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.