生数科技发布 Motus2:具身智能世界模型实现闭环自进化
机器人学习拧灯泡,若操作失误,如何获知问题所在并自我修正?这正是具身智能“自进化”的核心价值:在人类无法穷尽所有示范场景的前提下,让机器人具备评估动作结果并从反馈中持续学习的能力。
生数科技最新发布的 Motus2 模型,在此领域实现了重要突破。作为集大成的世界模型,Motus2 融合了触觉、灵巧操作及第一视角(Ego)数据等前沿技术要素。相较于今年 2 月发布的前代产品 Motus(在 50 项通用任务测试中成功率较 Pi-0.5 高出 35%),Motus2 进一步拓展了视觉、语言、动作与触觉多模态能力,在一个模型中同步构建了行动、预测与评估三大核心技能树。
该模型不仅能执行动作,还能预判后果并进行自我评分,三者无缝衔接形成闭环,标志着世界模型正式迈入自我进化阶段。
模型实现闭环自进化迭代
Motus2 的核心突破可概括为三个关键词,首要便是“自进化”。传统机器人策略模型多基于统计关联,仅记忆“看到 A 就做 B",缺乏对因果关系的理解,一旦环境变化极易失效。Motus2 则将三种能力整合于同一模型:
- 行动(WAM):生成动作,解决“接下来做什么”;
- 预测(AC-WM):推演后果,解决“做完会发生什么”;
- 评估(VM):判定结果,解决“这个结果好不好”。
关键在于,这三种能力形成了“生成动作→预测后果→评估结果→更新策略”的闭环。模型利用自身的预测和评估反馈改进策略,进入下一轮迭代,这是对递归自我改进(RSI)的初步探索。需注意,此处的“自进化”指利用模型内部反馈优化策略,而非在开放环境中无限自主学習。
为避免模型在训练中出现时序作弊(即利用未来帧反推动作),Motus2 采用"Action-first"信息流,严格遵循“先观测生成动作,再预测结果,最后评估”的顺序。在此基础上,模型通过两阶段机制将预测转化为决策信号:
推理阶段:采用 Best-of-N 规划。模型先生成多个候选动作并脑补其后果,由价值模型打分后选择最优解执行。执行一小段后重新观察真实世界,开启新一轮规划。
此举赋予机器人方案比较与优化的能力,将“脑内模拟”逻辑集成至视频 - 动作大模型中,无需单独训练轻量级模拟器。
训练阶段:实施基于模型的强化学习(MBRL)。候选动作的评分被转化为策略更新信号,高分方案获得正向引导,低分方案逐渐被摒弃。此阶段仅更新动作相关参数,保持预测和评估部分稳定,防止模型跑偏。
这一机制重塑了数据价值定义:失败轨迹不再被视为噪声,而是用于学习动作后果与结果评价的重要样本。真机实测数据显示,在手机放置和多指操作任务中,基础策略成功率为 65%;加入规划提升至 67.5%;加入 MBRL 达到 72.5%;两者结合则高达 75%,较基础策略提升 10 个百分点。
触觉和记忆补全视觉缺失信息
Motus2 的第二个核心特征是“全模态”,重点增强了触觉与记忆能力。
轻量级触觉专家模块
在灵巧操作中,视觉难以完全判断接触状态(如是否打滑、受力变化)。Motus2 引入轻量级触觉专家模块,在执行短动作片段前读取最新触觉反馈以细化动作。该模块复用主模型中间结果,无需重跑完整视频骨干,兼顾了反馈频率与计算效率,解决了接入触觉信号往往导致延迟增加的痛点。实测显示,在抽取纸杯和撕纸任务中,加入触觉后平均成功率从 60% 提升至 72.5%。
长短期记忆机制
针对依赖历史信息的任务(如隐藏物体寻找),Motus2 默认缓存近期真实观测。测试表明,保留完整历史信息的方案在相关任务中平均成功率达 57.5%,显著优于压缩历史信息方案。这证明对于长上下文任务,历史信息是决策的关键部分。尽管完整保存带来存储与计算压力,但在当前技术阶段,这是平衡“记得多”与“跑得快”的有效妥协。
人类操作经验迁移至高自由度灵巧手
第三个关键词是“高自由度灵巧手”。Motus2 已部署于单手 22 自由度的 Sharpa Wave 及 20 自由度的 WUJI Hand 2 等平台,完成拧灯泡、翻书等复杂任务。
Ego 数据驱动的迁移学习
面对高自由度带来的数据难题,Motus2 采用多层次 Ego 数据体系,将人类第一视角操作经验迁移至机器人: 1. 单目 Ego 视频预训练:学习基础物体与场景规律; 2. 双目视频与动作数据引入:细化手部与物体交互信息; 3. 机器人适配训练:利用机器人轨迹和人机对齐数据,将经验迁移至机器人控制空间。
该体系包含约 13 万小时人类第一视角数据及百小时级机器人数据。对照实验显示,仅经人类 Ego 数据预训练的模型成功率为 51%,加入机器人适配训练后跃升至 84%。这表明人类数据提供了规模化世界知识,而机器人数据完成了关键的控制适配。
此外,数据规模对比实验显示,随着双目数据量增加,模型在人类动作预测任务上的验证误差持续下降,尚未触及性能天花板,印证了堆叠人类数据提升模型性能的可行性。
从“能行动”到“会反思”的演进之路
生数科技将通用世界模型演进路线划分为五级:L1 生成世界、L2 与世界交互、L3 在世界中行动、L4 自主世界智能体、L5 世界组织者。Motus2 已具备 L3 核心能力,即理解状态、预测后果并输出真实动作。
迈向 L4“自主世界智能体”的关键,在于模型能否利用自身能力参与自我改进。Motus2 通过预测后果、价值评估及策略更新的闭环,初步触达了自主决策与持续自我改进的核心领域。尽管在触觉跨本体迁移、长任务预测可靠性及开放世界持续学习等方面仍存挑战,但 Motus2 成功验证了评价与反馈进入世界模型闭环的可能性,标志着世界模型技术迈出了坚实的一步。
项目主页与真机演示:https://motus-robotics.github.io/motus2/
论文链接:https://arxiv.org/abs/2608.30237

