
新智元报道

机器人自进化时代正式开启,自主世界智能体迈出关键一步。
9 月 10 日,在外滩大会现场,生数科技联合创始人、CEO 骆怡航发布生数 Motus2。这是一款面向灵巧操作的自我演化型通用世界模型。

Motus2 的核心突破在于让机器人不仅能执行动作,更能预演后果、评估结果并据此优化策略。在撕纸、翻书、开易拉罐、擀面团等高难度精细操作的真机演示中,Motus2 表现流畅。
通用具身智能体需在统一系统中完成感知、预测、行动、评估与改进的闭环,而世界模型是实现这一闭环的核心范式。然而,现有模型多将动作输出作为世界模拟器的简单外挂,缺乏结构性深度耦合,无法形成“决策—学习—策略改进”的自进化闭环。
针对该瓶颈,生数科技不仅引入触觉模态,更首次统一了“策略、模拟、评估”三大能力,结合触觉与历史信息,成功构建了自进化闭环。其核心创新包括:
- 统一决策与学习接口:以“动作优先”的因果信息流连接策略、模拟器和评估器,同时支持推理时规划与训练时策略优化。
- 扩展人类交互数据:从单目 Ego 视频扩展到双目视频—动作数据,并利用规模化人类操作经验服务于机器人灵巧操作。
- 补充历史与接触信息:通过记忆机制和轻量级触觉专家,解决单帧视觉难以完整感知状态的问题。
在放置小球、多指操作、贴合橡皮、拧灯泡、放置手机五项真机任务中,Motus2 平均成功率达 84%。

在放置手机和多指操作两项独立评测任务中,结合基于模型的强化学习与推理时规划,平均成功率从 65% 提升至 75%。

随着模型和数据的 Scaling,机器人已能在“脑海”中推演未来、自评行为并实现自我更新。
项目地址:https://motus-robotics.github.io/motus2/
论文地址:https://arxiv.org/abs/2608.30237

为什么需要「自进化」与「第三个接口」?
传统机器人灵巧操作多被视为简单的“从观测到动作”端到端映射。行为克隆或模仿学习依赖死记硬背,缺乏物理常识,既无法评判动作优劣,也难以在面对未知扰动时自我改进。
为此,研究者转向“自进化”范式,即让模型预测并评估候选动作后果,利用反馈闭环改进策略。此前的世界模型已具备策略(提出动作)和仿真器(预测后效)两种能力,生数科技上一代 Motus 模型也实现了两者的统一。但 Motus2 的关键推进,是将价值评估与策略改进纳入链路。

Motus 架构
仅会“预言”并不足够。若只知道“会怎样”而不知“好不好”,机器人无法做出最优决策。因此,自进化亟需第三个接口——评估器(价值模型)。
策略回答“尝试什么”,仿真器回答“发生什么”,评估器回答“结果如何”。这契合了清华朱军团队通用世界模型(GWM)的核心原则:动作必须是物理交互的因果接口,通过改变环境带来新信息,进入下一轮理解与预测。

Motus2:自进化通用世界模型的跨越
Motus2 颠覆性地重构架构,将三种能力融入同一套“视频—动作”共享权重模型中:
- 策略(WAM):根据指令、状态和历史生成动作。
- 仿真器(AC-WM):给定状态和动作,预测未来画面。
- 评估器(VM):依据动作及结果,判断任务进展。
三者共用一套参数,仅通过不同输入方式切换功能。

为防止模型“剧透未来”,Motus2 设计了“动作优先”(Action-first)因果流与掩码机制,确保块内自回归过程中,动作预测不依赖未来信息,而未来视频 token 可读取动作,价值查询可同时读取两者。

由此固化的因果链条为:生成动作 → 基于动作推演未来 → 评估未来价值。
该设计保留了联合训练优势,同时提升了部署灵活性:常规控制仅需生成动作,复杂规划或优化时再调用预测与评估能力。


闭环自进化:世界模型开始「用脑子」训练自己
Motus2 的革命性在于首次构建了“行动、预测、评估”的自进化正向飞轮,通过基于模型的强化学习(MBRL)与测试时规划(Inference-time Planning),将试错过程从物理世界移至模型“脑内”。

阶段一:决策前的「Best-of-N」推演
在执行动作前,Motus2 先生成 N 个候选动作,并在内部模拟器中推演每种可能性的后果。价值评估器迅速打分,选取最优解执行。这一机制赋予了机器人类似 AlphaGo 的推演规划能力。

阶段二:训练中利用「脑补未来」倒逼进化
在训练阶段,模型推演的未来画面与评分作为强化学习的奖励信号,直接微调动作策略。高分动作被强化,低分动作被抑制。
这一机制彻底改变了数据利用逻辑:失败轨迹不再是废料,而是教会模型“为何此路不通”的宝贵数据。

数据显示,在手机放置与多指操作任务中,基础策略成功率为 65%;引入 MBRL 优化后升至 72.5%;叠加推理时规划后,成功率进一步提升至 75%,整体提升 10 个百分点。

这意味着机器人可在无外部干涉下,依靠自我推演与评价实现策略持续进化。

破解「数据死穴」:13 万小时人类日常构建通天梯
面对机器人高精度遥操作数据稀缺的难题,生数科技提出颠覆性方案:利用海量人类第一人称视角数据,构建人类数据金字塔体系。
训练分为三个阶段:
- 单目 Ego 视频预训练:学习基础世界知识与行为变化规律。
- 双目视频—动作联合预训练:加入空间信息与三维手部姿态,掌握细粒度手—物交互规律。
- 机器人领域适配:利用少量机器人轨迹与人机对齐数据,将人类经验迁移至机器人控制空间。

实验表明,人类具身数据的 Scaling Law 依然有效。随着双目人类数据从 2,000 小时增至 20,000 小时,动作预测误差平滑下降。

在任务迁移实验中,纯人类数据预训练的成功率仅为 51%;经过金字塔体系训练并辅以百余小时领域对齐数据后,成功率飙升至 84%,提升幅度达 33 个百分点。


记忆与触觉:补全「时间神经」与「触感神经」
针对单帧视觉缺失历史信息与无法感知阻力的缺陷,Motus2 引入了长时记忆机制与全模态触觉专家。
记忆机制:治愈「金鱼脑」
Motus2 对比了滑动窗口、全局自回归及混合记忆等多种方案。实验显示,融合长时信息机制的模型在长上下文仿真与真机任务中表现优异,成功率达 57.5%,远超压缩历史信息的模型。


触觉专家:赋予指尖敏感神经
为解决视觉延迟与遮挡问题,Motus2 引入轻量级触觉专家模块。该模块复用主模型中间计算结果,兼顾了反馈频率与计算效率。

在抽纸杯与撕纸等对接触力敏感的实验中,引入触觉模块后,成功率从 60% 提升至 72.5%,净增 12.5 个百分点。


从 L3 到 L4:迈向自主世界智能体
Motus2 验证了“动作→预测→评估→改进”的完整路径,标志着生数科技从 L3“在世界中行动”向 L4“自主世界智能体”的关键跨越。
参考朱军团队提出的通用世界模型五级发展路线(生成世界、交互、行动、自主智能体、世界组织者),生数科技的产品演进脉络清晰:Vidu 积累动态生成能力,Vidu S1 探索实时交互,而 Motus 系列则致力于将预测与物理行动深度绑定。

Motus2 构筑了完整的生命周期闭环:行动 → 预测 → 评估 → 反馈 → 再学习。

尽管触觉跨本体迁移与长时程预测稳定性仍是行业挑战,但 Motus2 证明了世界模型具备在不依赖人类填鸭式教学的前提下,通过自我预测与反思不断进化的能力。

从被动执行脚本到主动权衡未来代价,具身智能的世界模型底座正加速演进。当机器学会“三思而后行”,物理世界的 AGI 时代已近在咫尺。
参考资料:
https://motus-robotics.github.io/motus2/
https://arxiv.org/abs/2608.30237
编辑:大卫

