01 核心Insight
Worldscape-MoE 最重要的判断是:不同动作接口虽然长得完全不一样,但它们约束的是同一个世界。相机轨迹描述视角如何穿过空间,机械臂动作描述机器人如何接触和移动物体,手关节 action map 描述第一人称交互中双手如何改变场景;这些信号的表示形式不同,但都要求模型遵守物体一致性、时序连续性、物理接触和动作因果。
所以,异源控制统一的关键,不是强行把所有动作翻译成同一种格式,而是把问题拆成两层:一层学习跨控制共享的世界规律,一层学习各自控制接口的动作语义。Worldscape-MoE 因此将 MoE 引入 Diffusion Transformer,在每个样本中同时激活共享专家和对应模态专家。共享专家负责沉淀跨控制的世界知识,专属专家负责解释某一种控制接口下的细粒度动作含义。
这与普通 dense mixed training 有本质区别。后者会把相机控制、机械臂控制、手部控制全部混进同一条参数路径,结果很容易出现梯度冲突;Worldscape-MoE 则把异源监督从“互相拉扯的训练噪声”,变成“共同放大的世界知识”。简单说,它不是训练多个世界模型,也不是把多类数据硬塞进一个模型,而是在同一个 DiT 世界模型里同时建立共享世界路径和控制专用路径。
一句话概括:Worldscape-MoE 统一的不是动作格式,而是动作作用于世界之后的动态规律。
02 多类控制进一个世界
Worldscape-MoE 覆盖了当前具身世界模型中最典型的三类控制范式。第一类是 Locomotion,面向场景探索、空间导航和交互式世界漫游,控制信号通常是相机轨迹或局部视角变化;第二类是 Manipulation,面向机器人操作要求模型理解机械臂运动、物体接触和任务状态变化;第三类是 Action Map,面向第一人称手部交互,模型根据像素对齐的手关节动作图生成与手-物交互一致的未来视频。
这三类信号没有被粗暴压缩成一种通用 token,而是通过各自最合适的方式注入同一个 diffusion backbone:轨迹控制经由 Control Adapter 对齐到视频 latent 并融合进 patch-level video tokens;手部 action map 先编码为 latent control feature,再作为视觉条件注入;机械臂动作则通过 Action MLP 编码为紧凑动作嵌入,并沿 DiT 的 timestep modulation 路径影响生成动态。
这套设计的高明之处在于,每种动作保留自己的结构,进入模型后又共享同一个世界建模主干。轨迹仍然像轨迹,机械臂动作仍然像机械臂动作,手部 action map 仍然像手部 action map;真正被统一起来的,是它们共同指向的世界变化。
03 MoE不是堆参数,而是拆解控制冲突
04 WorldScape-MoE Tuning
如果每新增一种控制信号都要重新训练一个世界模型,那么世界模型就很难真正成为基础设施。Worldscape-MoE 进一步提出 Worldscape-MoE Tuning,将异源控制扩展变成一个渐进式过程:先从预训练视频生成模型出发,接入相机控制和机械臂控制,建立稳定生成先验、空间轨迹控制和基础具身操作能力;随后逐步加入新的控制模态和对应专家。
这里有一个很关键的设计:新专家不是随机初始化,而是从当前 shared expert 初始化。这意味着新控制分支一开始就继承了模型已经学到的世界常识,再在自己的控制接口上做专门化。同时,训练采用 grouped learning-rate 策略,shared expert 和预训练继承参数使用更保守的学习率,新加入或强模态相关模块使用更高学习率,从而避免新模态冲掉已有世界知识。
这让世界模型的扩展方式发生变化:过去是“为每种控制重新造一个模型”,现在是“往同一个世界里接入一种新控制”。未来无论加入单臂机器人、灵巧手、移动底盘、全身 humanoid 动作,还是触觉、力反馈、工具轨迹等更复杂监督,都可以沿着这一路径继续扩展。实验证明,多专家的混合训练使得单个专家也能取得最优性能,Worldscape-MoE在通用世界模型权威评测榜单长期占据榜首位置。
05 强泛化能力与跨控制组合
Worldscape-MoE 的另一个亮点是 out-of-distribution (OOD)generalization 和 loco-manipulation。论文展示了模型在三类运动域上的 OOD 表现:它能在视觉分布变化很大的场景中保持相机运动一致性;能把模拟器中的机器人操作泛化到更真实的家具服务场景;也能把手部控制迁移到未见过的第一人称交互环境。这说明共享专家并不是简单记忆训练分布,而是在学习可复用的场景动态和物理规律。
更有想象空间的是 loco-manipulation。过去,移动和操作往往对应两个模型、两类数据、两套控制接口;Worldscape-MoE 将它们放进一个共享世界表示之后,模型开始能够生成耦合的移动-操作行为。对于未来具身 Agent 来说,这一点非常关键:真实任务不会只包含一种动作,智能体需要走到桌边、调整视角、伸手拿起物体、避开障碍并继续完成任务,而这些动作都发生在同一个连续世界中。
从这个角度看,Worldscape-MoE 的意义不只是“支持了三种控制”,而是开始把原本割裂的控制能力重新放回同一个世界里。世界模型只有同时理解“我怎么移动”和“我怎么操作”,才可能成为真正服务具身智能的内部模拟器。
--推荐阅读--

