沉寂近半年后,小米大模型团队负责人罗福莉公开亮相,宣布小米在强化学习方向的最新进展:MiMo-V2.6系列模型Flash与Pro的强化学习训练过程首次以直播形式对外开放。训练页面上,花费金额、训练步数、奖励曲线变化、显卡故障节点等信息全部公开可查。据页面数据,从Pro模型开始训练算起,36小时内两款模型已花费超过108万美元,平均每小时约3万美元。

目前两款模型训练仍处初期,仅进行了一天多,但已能观察到明显的能力提升。Pro的dynsam/avg@n从第1步的约0.565提升至0.614,Flash则从约0.514提升至0.603。在最新公开的DeepSWE v1.1离线评测中,Pro和Flash分别达到62.24和60.77,对比DeepSeek-Flash v1.1的74.2%仍有差距。Flash从更低起点快速追近,Pro目前保持小幅领先,但由于Pro完成一个Step更慢,最新评分尚未出炉。

罗福莉解释,团队这半年只研究了一件事:强化学习能扩展到多远。传统预训练scaling的逻辑是更多数据、更多参数、更多算力带来更强模型,而前沿模型越来越关注RL能否同样scaling。小米给出的答案是沿三个维度扩展:训练计算量、环境与执行框架、评分计算量。

在训练计算量维度,MiMo-V2.6系列每个训练Step约处理20亿Token,配置为1568个Prompt乘以每个Prompt 16条Rollout,一轮可产生超过2.5万条Rollout。对于Agent任务,一条Rollout可能经历数十轮思考、工具调用与环境反馈,单个Step的Token数可达数十亿级别。系统采用完全异步执行方式,生成、执行、评分和训练不再严格排队,而是组成持续运转的异步流水线。

在环境与执行框架维度,MiMo-V2.6进行Multi-task Agentic RL,代码、通用任务、视觉、Chat等不同类型任务可混合到同一次RL Run中训练,并运行在不同Harness里。直播页面专门展示Batch Composition,用于说明每个训练Step中模型正在从何种任务和环境获取经验。第三个维度是Grader Compute,即为打分本身增加算力,以应对复杂Agent任务中奖励难以像数学选择题那样直接获得的问题。