大数跨境

罗福莉沉寂半年官宣小米强化学习!直播新模型训练过程,一小时烧3万美元

罗福莉沉寂半年官宣小米强化学习!直播新模型训练过程,一小时烧3万美元 量子位
2026-09-17
23
导读:奖励曲线、显卡故障全公开

小米直播强化学习训练:每小时烧钱 3 万美元

小米新模型的强化学习(RL)训练过程罕见地开启了现场直播。数据显示,训练成本高昂,自 Pro 模型启动以来的 36 小时内,两款模型累计消耗超过 108 万美元,平均每小时耗费约 3 万美元。

此次直播不仅展示了资金消耗速度,更实现了训练全过程的透明化。页面实时公开训练花费、运行步数、奖励曲线变化以及节点显卡故障等关键指标,开创了开放训练过程的先河。

MiMo-V2.6 训练进展与性能表现

目前 MiMo-V2.6 的 Flash 和 Pro 两款模型尚处于训练初期(约 1 天),但已在强化学习过程中展现出显著的能力提升。

数据显示,Pro 模型的 dynsam/avg@n 指标从初始的 0.565 提升至 0.614;Flash 模型则从 0.514 快速追至 0.603。在最新公开的 DeepSWE v1.1 离线评测中,Pro 和 Flash 分别达到 62.24 和 60.77 分(作为参考,DeepSeek-Flash v1.1 为 74.2%)。由于 Pro 模型单步训练耗时较长,其最新评分暂未更新。

自今年 4 月开源 MiMo-v2.5 后,小米团队沉寂近半年。项目负责人罗福莉表示,期间团队专注于研究一个核心问题:强化学习(RL)的扩展边界究竟有多远。

小米公开强化学习 Scaling 三大维度

传统预训练的 Scaling 定律已广为人知:更多数据、参数和算力带来更强模型。小米此次探索的核心在于验证 RL 是否遵循类似的扩展规律,即通过增加轨迹生成量、任务环境多样性及评判算力,能否持续提升模型能力。小米给出的方案是沿三个维度进行扩展:训练计算量、环境与执行框架、评分计算量。

计算量的 Scaling

首个维度是扩大 RL 本身的计算规模。MiMo-V2.6 系列每个训练 Step 处理约 20 亿 Token,配置为 1568 个 Prompt,每个 Prompt 生成 16 条 Rollout(尝试轨迹)。这意味着单轮训练可产生超过 2.5 万条 Rollout。针对 Agent 任务,每条 Rollout 包含多轮思考、工具调用及环境反馈,使得单步 Token 消耗达到数十亿级别。

系统采用了 Fully Async(完全异步)执行方式。不同于传统流水线式的串行处理,MiMo 的系统允许不同任务并行处于生成、执行、评分或训练等不同阶段,形成了一套持续运转的异步流水线,极大提升了大规模 Agent RL 的训练效率。

环境的 Scaling

第二个维度是扩展训练环境和执行框架(Environments and Harnesses)。MiMo-V2.6 实施多任务 Agent RL,将代码、通用任务、视觉、对话等不同类型任务混合训练,并运行在不同的执行框架中。例如,编程 Agent 可调用终端和测试工具,而视觉 Agent 则面对完全不同的反馈机制。此举旨在扩展模型所能进入的环境种类、使用的工具类型及解决的问题范畴。

评分的 Scaling

第三个维度是增加评分计算量(Grader Compute)。在复杂 Agent 任务中,简单的成败判定不足以提供有效反馈,评分者本身需消耗大量算力。此外,信用分配(Credit Assignment)是关键难题:在长达数十步的任务执行中,系统需精准识别哪些动作促成了成功,哪些是无效操作。

MiMo 引入了"Agentic In-group Credit Assignment"机制,利用同一 Prompt 生成的多条 Rollout 进行对比分析,从而提取比单一结果更细致的强化学习信号,明确哪些行为应受鼓励或抑制。

综上所述,小米通过扩展计算量以产生更多经验、扩展环境以获得多样经验、增加评分算力以提取精准信号,构建了一套完整的 RL Scaling 体系。正如业界观点所言,这三项扩展的本质均指向算力的深度投入。

参考链接:
https://mimo.xiaomi.com/rl
[2] https://x.com/_LuoFuli/status/2100296686719610932

【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16460
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读436.0k
粉丝1
内容16.5k