一句话洞察
当行业还在争论”仿真数据vs真实数据”时,小米直接用10万小时真实世界UMI轨迹+自动标注pipeline+两阶段训练配方,在RoboCasa365上将SOTA从46.6%推高到57.6%——机器人学习的Scaling Law,终于来了。
机器人学习的“数据荒”:为什么Scaling在具身智能领域如此困难?
大语言模型的成功有一条清晰的主线:GPT-3用175B参数和570GB文本数据证明了 emergent abilities 的存在,GPT-4通过更大规模的训练实现了质的飞跃。视觉-语言模型(VLM)紧随其后,CLIP、LLaVA、Qwen-VL等系列模型在数十亿图像-文本对上训练,展现出强大的多模态理解能力。
但在机器人领域,这条Scaling曲线一直磕磕绊绊。核心瓶颈只有一个:数据。
领域 |
数据规模 |
采集方式 |
核心瓶颈 |
大语言模型 |
万亿级token |
互联网爬取 |
计算资源 |
视觉-语言模型 |
十亿级图文对 |
互联网爬取+人工标注 |
计算资源 |
机器人操作 |
百万级轨迹(少数) |
真实机器人遥操作 |
数据采集成本 |
传统的真实机器人遥操作数据采集面临三重困境:
· 第一,速度慢。一个熟练的操作者每小时只能采集几十条轨迹,而训练一个像样的策略模型通常需要数万条轨迹。
· 第二,成本高。每条轨迹需要占用真实的机器人硬件、操作者时间、场地空间——这些成本随着数据量线性增长。
· 第三,多样性受限。遥操作数据天然集中在有限的任务和环境上(实验室桌面、固定场景),难以覆盖真实世界的丰富变化。

【对应论文图3】
Xiaomi-Robotics-1的预训练数据集,包含超过10万小时真实世界UMI轨迹,覆盖家庭、商业场所、工业现场、办公室和户外等大规模环境。
正是这个”数据荒”,让许多研究者转向仿真数据——仿真环境可以并行采集、无限重置、自动标注。但仿真到真实的鸿沟(sim-to-real gap)始终是悬在头顶的达摩克利斯之剑。
小米的答案是:用UMI设备在真实世界”野外”采集,然后用自动标注pipeline解决标注瓶颈。
Xiaomi-Robotics-1架构:Mixture-of-Transformers的双塔设计
Xiaomi-Robotics-1采用了Mixture-of-Transformers(MoT)架构,将预训练的视觉-语言模型(VLM)与扩散Transformer(DiT)巧妙耦合。

【对应论文图2】
模型架构图。VLM编码观察和语言指令,并通过Choice Policies预测动作块以加速训练收敛。DiT基于机器人状态和VLM的KV cache,通过Flow Matching生成动作块。
2.1 模型架构:VLM + DiT的双塔协同
组件 |
功能 |
配置(5B模型) |
关键设计 |
VLM |
编码视觉观察和语言指令 |
Qwen3-VL,36层,2560 hidden |
预训练权重初始化 |
DiT |
生成动作块 |
36层,1024 hidden |
匹配VLM层数,更小hidden size |
Choice Policies |
VLM上的辅助动作监督 |
K个候选动作+评分 |
winner-takes-all训练 |
模型提供三个规模变体:
【对应论文表1】
不同规模变体的详细配置。注意DiT的hidden size(1024-2048)远小于VLM(2048-4096),这是为了加速推理——动作生成器的计算开销被控制在合理范围内。
2.2 Flow Matching:连续时间扩散生成动作
Xiaomi-Robotics-1使用Flow Matching作为动作生成机制:

其中
是噪声动作,τ 从Beta分布采样:

这种偏置的Beta采样将更多权重放在噪声更大的时间步,使模型在训练时更关注”去噪”过程——从混乱的随机动作中恢复出精确的专家轨迹。
推理时,模型从随机噪声
出发,通过5步Euler积分恢复干净的动作块:

2.3 Choice Policies:防止VLM”偷懒”的关键设计
这是Xiaomi-Robotics-1架构中最精妙的设计之一。研究团队在VLM上引入了辅助的动作生成监督——Choice Policies:
具体做法:
· 将机器人状态编码为token,与动作查询token、评分查询token一起拼接到视觉-语言序列末尾
· VLM输出K个候选动作块
和对应的评分 
· 采用winner-takes-all策略:只有与真值动作L1距离最小的候选参与损失计算

其中
,即候选动作与真值动作的L1距离作为评分目标。
为什么这个设计如此重要?
VLM是计算瓶颈(参数量大、层数深)。通过在VLM上直接施加动作生成监督,可以将VLM的表示”拉向”更有利于动作生成的方向,使DiT的学习更加高效。但这里有一个微妙的平衡——如果让DiT直接关注VLM中动作相关token的KV cache,DiT会走”捷径”:直接复制VLM生成的动作,而不是基于视觉和语言上下文独立推理。
解决方案:将动作相关token从DiT的注意力计算中排除。这迫使DiT必须独立地基于视觉观察和语言指令进行动作推理,而不是简单抄袭VLM的输出。
2.4 训练目标:三 loss 联合优化

其中 λ = 0.1,
是视觉-语言数据的next-token-prediction损失,用于保留VLM的预训练能力。视觉-语言数据与UMI轨迹的采样比例为1:9,确保预训练以动作学习为主。
训练吞吐优化:VLM比DiT计算昂贵得多,为此团队采用了两项优化:
· 将一个batch内所有视觉-语言token打包成单个序列,一次性通过VLM
· 每个样本采样4个Flow Matching时间步,打包后一次性通过DiT
数据引擎:10万小时真实世界轨迹的规模化采集与自动标注
3.1 预训练数据:UMI”野外”采集

【对应论文图3】
预训练数据集的视觉概览。超过10万小时真实世界UMI轨迹,覆盖家庭、商业场所、工业现场、办公室和户外环境。
Xiaomi-Robotics-1的预训练数据采用UMI(Universal Manipulation Interface)设备采集——这是一种手持夹爪+自监督相机系统,无需真实机器人即可在自然环境中采集操作轨迹。这种方式的三大优势:
优势 |
传统遥操作 |
UMI野外采集 |
速度 |
慢(需要真实机器人) |
快(手持设备,随处可用) |
多样性 |
有限(实验室场景) |
极高(家庭、户外、工业) |
成本 |
高(硬件+场地+人力) |
低(便携设备) |
数据覆盖的任务类型极其丰富:拾取放置、开门抽屉、倒水、整理桌面、工具使用等日常操作。更重要的是,这些轨迹是在”野外”(in-the-wild)采集的——真实的家庭环境、真实的物体、真实的干扰因素。
3.2 自动标注Pipeline:两周标注10万小时
传统标注的困境:每条轨迹需要人工按任务语义分段,并为每段标注语言指令。10万小时的数据,如果人工标注,需要数年时间和巨大人力成本。

【对应论文图11】
自动标注示例。Qwen3.5-27B为轨迹片段生成状态转移的语言描述。
Xiaomi-Robotics-1的解决方案是利用预训练的VLM(Qwen3.5-27B)自动标注:
· 等长分段:将每条轨迹切分为固定长度的片段
· 状态转移描述:VLM生成描述夹爪和交互物体状态转移的自然语言
· 高效pipeline:生产者-消费者架构,CPU线程切分视频片段到内存文件系统,客户端线程并行发送数百个标注请求
整个10万小时语料库的标注仅需约两周完成。标注结果描述了场景的当前状态到目标状态的转移,例如:“夹爪从打开变为闭合,杯子从桌面被提起”——这些精确且丰富的语义监督为动作学习提供了强大的条件信号。

【对应论文图6】
预训练的定性结果——模型能够根据状态转移的语言描述,预测UMI夹爪的动作轨迹。
3.3 后训练数据:跨本体对齐
【对应论文图4】
后训练数据集概览。约1万小时跨本体轨迹,包括7200+小时自有移动操作机器人数据、1000+小时人工标注UMI数据、开源机器人数据集。
后训练数据集包含四个来源:
数据来源 |
规模 |
用途 |
采样比例 |
自有机器人数据 |
7200+小时 |
移动操作+双臂机器人,家庭环境 |
85% |
人工标注UMI数据 |
1000+小时 |
时序分段+语言指令标注 |
5% |
开源机器人数据 |
- |
Bridge V2, RT-1, DROID |
5% |
视觉-语言数据 |
- |
保留VLM能力 |
5% |
后训练的核心目标是两个对齐:
· 本体对齐:将预训练获得的UMI夹爪动作能力迁移到真实机器人(移动操作臂、双臂机器人)
· 指令对齐:将预训练使用的”状态转移描述”转换为人类自然的祈使句指令(如”请把鞋子放到鞋柜里”)
动作空间统一采用相对delta末端执行器位姿表示,确保不同机器人平台之间相似动作产生一致的动作值。
Scaling实验:数据和模型规模的双维度验证
4.1 预训练数据Scaling:验证误差单调下降

【对应论文图5】
预训练Scaling曲线。左图为数据Scaling(12.5%/25%/50%/100%的20k小时数据),右图为模型Scaling(2B/5B/10B)。
数据Scaling实验使用Xiaomi-Robotics-1-5B模型:
数据比例 |
验证动作误差趋势 |
关键观察 |
12.5% |
先降后升(过拟合) |
数据不足,模型记住而非学习 |
25% |
先降后升(过拟合) |
仍然过拟合,但程度减轻 |
50% |
单调下降 |
数据量突破临界值 |
100%(20k小时) |
单调下降,斜率更陡 |
数据是主要瓶颈 |
关键发现:当数据量达到50%(约10k小时)时,验证误差开始单调下降,过拟合现象消失。这表明十亿参数级别的模型容量已经足够捕捉当前数据分布,数据量才是进一步提升性能的主要瓶颈。
模型Scaling实验在20k小时数据上训练2B/5B/10B三个变体:
模型规模 |
验证误差 |
与数据Scaling的差距 |
2B |
较高 |
- |
5B |
中等 |
性能差距不如数据Scaling明显 |
10B |
最低 |
提升幅度有限 |
核心结论:模型规模的提升带来的性能增益不如数据规模的提升显著。这进一步印证了”数据是机器人学习Scaling的首要瓶颈”这一判断。
4.2 后训练开箱即用:Scaling行为直接转移

【对应论文图8】
后训练定量结果,展示了不同预训练数据规模和模型规模下的开箱即用成功率。
数据Scaling转移到后训练:
预训练数据 |
整体成功率 |
关键任务表现 |
无预训练(Qwen3-VL基线) |
26% |
鞋子整理完全失败(0%) |
12.5%预训练数据 |
53% |
成功率翻倍 |
25%预训练数据 |
~60% |
持续增长 |
50%预训练数据 |
~69% |
边际增益减缓 |
100%预训练数据 |
75% |
鞋子整理达75% |
最引人注目的发现:预训练数据Scaling的增益在接触丰富的操作任务上最为显著。基线模型在鞋子整理任务上完全失败(0%),而100%预训练数据模型达到75%。这说明大规模预训练赋予模型强大的物理交互理解能力。
模型Scaling转移到后训练:
模型规模 |
整体成功率 |
鞋子整理 |
2B |
61% |
58% |
5B |
75% |
75% |
10B |
79% |
92% |
模型Scaling在鞋子整理任务上效果最为显著——从58%(2B)→75%(5B)→92%(10B),展示了模型容量对复杂任务的决定性影响。
综合结论:预训练数据规模和模型规模是两个互补的Scaling维度。更强的预训练模型在后训练中展现出更好的开箱即用性能。

【对应论文图7】
后训练评估的四个任务——鞋子收纳、包打包、桌面整理、沙发整理。评估环境完全未在训练中见过。
下游任务微调:<10小时数据实现75%成功率
5.1 四个复杂灵巧任务

【对应论文图9】
下游微调评估的四个任务——手机打包、洗衣加载、打印机加纸、盒子打包。
任务 |
核心挑战 |
低数据设置 |
手机打包 |
双手协调 |
~9小时 |
洗衣加载 |
长程移动操作,多步指令跟随 |
~9小时 |
打印机加纸 |
高度可变形物体(纸张)处理 |
~10.3小时 |
盒子打包 |
跨多物体语言 grounding |
~8小时 |
这些任务完全未在预训练和后训练数据中出现,用于评估模型的迁移学习能力。
5.2 数据效率对比:Xiaomi-Robotics-1 vs π0.5 vs Xiaomi-Robotics-0

【对应论文图10】
下游微调定量结果。低数据和高数据设置下的成功率和进度对比。
低数据设置(平均<10小时/任务):
模型 |
平均成功率 |
平均进度 |
π0.5 |
40% |
66% |
Xiaomi-Robotics-0 |
~45% |
~70% |
Xiaomi-Robotics-1 |
75% |
90% |
关键发现:
· 手机打包Xiaomi-Robotics-1在两个数据设置下都大幅超越基线,展示双手协调能力
· 打印机加纸:将最佳基线成功率从20%提升到70%(低数据)——可变形物体操作是Xiaomi-Robotics-1的显著优势
· 洗衣加载:低数据设置下80%成功率,96%进度——长程任务鲁棒性极强。π0.5 struggle于打开洗衣机门,Xiaomi-Robotics-0在低数据下完全失败
· 盒子打包:所有方法表现较好,高数据下均达100%
高数据设置(144小时总计):所有方法均受益,但Xiaomi-Robotics-1的数据效率优势保持——用更少的数据达到更高的性能。
仿真基准测试:四个benchmark全面SOTA
6.1 RoboCasa:真实厨房环境单臂操作

【对应论文表2】
RoboCasa基准结果。
24个日常厨房操作任务,涵盖拾取放置、关节物体交互、电器操作、咖啡制作。Xiaomi-Robotics-1以74.5%的成功率登顶。
6.2 RoboCasa365:大规模通用操作(最显著突破)
【对应论文表3】
RoboCasa365基准结果。
这是Xiaomi-Robotics-1最耀眼的成果。RoboCasa365将基准扩展到365个任务、2500+程序化生成厨房场景、3200+物体实例:
方法 |
平均原子 |
组合-已见 |
组合-未见 |
Diffusion Policy |
6.1% |
15.7% |
0.2% |
π0.5 |
16.9% |
39.6% |
7.1% |
GR00T N1.6 |
21.9% |
51.1% |
9.4% |
WorldDreamer |
35.3% |
66.3% |
26.7% |
ABot-M0.6(前SOTA) |
46.6% |
79.4% |
48.3% |
Xiaomi-Robotics-1 |
57.4% |
80.2% |
57.1% |
Xiaomi-Robotics-1将平均SOTA从46.6%推高到57.4%——10.8个百分点的巨大飞跃。
更引人注目的是组合-未见(Composite-Unseen) split——评估模型是否能将已学原子技能重组为新任务:
• ABot-M0.6:48.3%
• Xiaomi-Robotics-1:57.1%
这意味着Xiaomi-Robotics-1不仅在已知任务上做得更好,更重要的是能够将学到的技能组合起来解决从未见过的新任务——这是通用机器人智能的核心标志。
6.3 VLABench:语义理解与分布偏移

【对应论文表4】
VLABench基准结果。SR=成功率,PS=进度分,IS=意图分。
Xiaomi-Robotics-1在跨类别(+6.0% vs ERVLA)和纹理偏移(+15.2% vs ERVLA)上表现尤为突出,展现了对 unseen objects 和视觉外观变化的强大鲁棒性。
6.4 RoboDojo:综合能力评估(最大幅度领先)

【对应论文表5】
RoboDojo基准结果。每个条目报告 score / success rate。
Xiaomi-Robotics-1的RoboDojo平均分从前SOTA 13.07飞跃到20.07——53.5%的相对提升。
在五个维度中的四个维度排名第一:
· 泛化(23.55 vs 14.12):对物体/布局变化的鲁棒性
· 精度(26.69 vs 17.33):细粒度控制能力
· 长程(38.39 vs 25.74):多步执行能力
· 开放(3.94 vs 1.98):开放式指令跟随
(记忆维度因未显式建模历史观察,略低于Hy-Embodied-0.5-VLA)
07
核心启示:机器人学习的Scaling Law 已经到来
设计原则 |
传统方法 |
RDP |
效果 |
触觉使用 |
观测级融合 |
动作级闭环 |
实时力控制 |
控制频率 |
单一频率 |
快慢分层 |
慢1-2Hz + 快>20Hz |
遥操反馈 |
纯视觉/振动 |
AR触觉可视化 |
精细力感知 |
传感器成本 |
$3000+ |
~$550 |
5倍成本降低 |
RDP的成功为机器人模仿学习提供了几个关键启示:
· 启示一:观测级融合 ≠ 动作级闭环
将触觉信息加入观测向量(如DP+触觉嵌入)并不能解决开环执行的根本问题。真正的触觉控制需要在动作执行层面实现闭环——RDP通过快慢分离架构,让触觉信号直接影响每个执行步骤的动作输出,而非仅作为观测”参考”。
· 启示二:模仿人类神经控制架构是有效的
人类的前馈预测+闭环微调双系统架构,在机器人控制中同样有效。慢策略负责复杂规划(保留扩散模型的多模态建模能力),快策略负责即时反应(<1ms的闭环控制)。这种分离使两个系统可以各自优化,互不干扰。
· 启示三:低成本触觉系统可以释放巨大潜力
TactAR用$499的VR头显+$50的MCTac传感器,就实现了过去需要$3000+力传感器才能实现的力反馈遥操。这种低成本方案使高质量的触觉示教数据采集变得触手可及。
本文内容整理自学术论文:《Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories》,仅作学术分享使用,版权归原作者及出版方所有。
• 论文作者:Jun Guo, Piaopiao Jin, Jason Li, Peiyan Li, Yingyan Li, Futeng Liu, Wangli Peng, Optimus Qin, Yifei Su, Nan Sun, Qiao Sun, Runze Suo, Heyun Wang, Yunhong Wang, Rujie Wu, Caoyu Xia, Lina Zhang, Jack Zhao, 以及小米机器人团队更多成员
• 发表单位:小米机器人(Xiaomi Robotics)
• 项目页面:https://robotics.xiaomi.com/xiaomi-robotics-1.html
• 代码和模型检查点:将开源发布
关注【具身智能制造】,每周拆解机器人与 AI 领域顶会,带你紧跟前沿技术~

