小米新模型的强化学习训练开启了前所未有的“现场直播”。这不仅是一场技术展示,更是一场高成本的算力实验:平均每小时消耗约 3 万美元,36 小时内两款模型已投入超 108 万美元。
该页面实时公开了训练成本、步数、奖励曲线及节点故障等核心数据。不同于以往仅开放权重或代码的做法,小米此次直接公开训练全过程,引发业界高度关注。
目前,MiMo-V2.6 的 Flash 和 Pro 两款模型训练刚起步一天多,但能力已有显著提升。在 DeepSWE v1.1 离线评测中,Pro 和 Flash 分别达到 62.24 和 60.77 分。其中 Flash 模型起点较低但追赶迅速,Pro 模型虽保持小幅领先,但因单步训练耗时较长,最新评分尚未更新。
自今年 4 月开源 MiMo-v2.5 后,小米团队沉寂半年,专注于研究“强化学习能扩展到多远”这一核心命题。
小米公开如何 Scaling 强化学习
传统预训练的 Scaling 定律遵循“更多数据×更多参数×更多算力”的路径。小米此次探索的是强化学习(RL)是否同样适用该定律,即通过增加生成轨迹数量、任务环境多样性及评分计算投入,能否持续提升模型能力。其解决方案聚焦于三个维度的扩展:
计算量的 Scaling
第一维度是扩大 RL 本身的计算规模。MiMo-V2.6 系列每个训练 Step 处理约 20 亿 Token,配置为 1568 个 Prompt,每个 Prompt 生成 16 条 Rollout(解题轨迹)。这意味着单轮可产生超 2.5 万条轨迹。对于 Agent 任务,每条轨迹包含多轮思考、工具调用及环境反馈,使得单 Step Token 量达到数十亿级别。
系统采用 Fully Async(完全异步)执行方式。不同于传统流水线的串行处理,MiMo 系统中不同任务处于不同阶段:部分 Agent 正在执行,部分等待判分,部分计算 Reward,新任务同时进入。生成、执行、评分和训练组成了一套持续运转的异步流水线,大幅提升了大规模 Agent RL 的效率。
环境的 Scaling
第二维度是扩展训练环境与执行框架(Environments and Harnesses)。MiMo-V2.6 实施多任务 Agent RL,将代码、通用任务、视觉、对话等不同类型任务混合训练,并运行于不同的 Harness 中。例如,编程 Agent 可操作终端与测试,而视觉 Agent 则面对完全不同的工具链。此举旨在扩展模型所能进入的环境种类、使用的工具类型及解决的问题范畴。
评分的 Scaling
第三维度是增加评分计算量(Grader Compute)。复杂 Agent 任务的奖励机制远超简单的对错判断,评分者本身需消耗大量算力。核心难点在于信用分配(Credit Assignment):在多步操作中,系统需精准识别哪些动作促成了成功,哪些是无效步骤。
MiMo 提出了"Agentic In-group Credit Assignment"概念,利用同一 Prompt 生成的 16 条不同轨迹及其结果进行对比分析,从而提取比单一成败信号更细致的强化学习反馈,指导模型优化行为策略。
综上所述,小米构建了一套完整的 RL Scaling 体系:通过扩展计算量积累更多经验,扩展环境多样性丰富经验来源,增加评分计算量以提取更精准的学习信号。这标志着模型与环境交互、评价及学习的整个 RL 循环,正演变为一台可持续扩大规模的机器。正如业内专家所言,这三重扩展的本质,均是对算力的极致运用。


