大数跨境

世界不是一座座孤岛,Manifold AI 流形空间开源世界模型 MoE 训练框架,统一异源动作控制

世界不是一座座孤岛,Manifold AI 流形空间开源世界模型 MoE 训练框架,统一异源动作控制 Manifold AI流形空间
2026-07-15
4
导读:Manifold AI 流形空间正式发布业内首个面向异源动作控制的世界模型 MoE 训练框架,让世界不是一座座孤岛。
世界模型从“会生成视频”的模型,变成具身智能的底层基础设施。但当前世界模型还远没有形成一个统一的“世界”:

做空间探索的,围绕相机轨迹、键盘鼠标或导航指令训练;做机器人操作的,依赖机械臂关节动作或末端执行器状态;做第一人称交互的,使用手部姿态、手关节和action map。

它们看起来都在建模同一个物理世界,却被不同的动作接口切成了一座座孤岛。数据不能自然汇合,能力不能相互复用,模型也很难随着新控制信号持续扩展。

Manifold AI 流形空间开源业内首个面向异源动作控制的世界模型 MoE 训练框架 Worldscape-MoE,让 locomotion、robotic manipulation 和 egocentric hand motion 等主流控制信号在同一个世界模型里共同学习。

01 核心Insight

Worldscape-MoE 最重要的判断是:不同动作接口虽然长得完全不一样,但它们约束的是同一个世界。相机轨迹描述视角如何穿过空间,机械臂动作描述机器人如何接触和移动物体,手关节 action map 描述第一人称交互中双手如何改变场景;这些信号的表示形式不同,但都要求模型遵守物体一致性、时序连续性、物理接触和动作因果。

所以,异源控制统一的关键,不是强行把所有动作翻译成同一种格式,而是把问题拆成两层:一层学习跨控制共享的世界规律,一层学习各自控制接口的动作语义。Worldscape-MoE 因此将 MoE 引入 Diffusion Transformer,在每个样本中同时激活共享专家和对应模态专家。共享专家负责沉淀跨控制的世界知识,专属专家负责解释某一种控制接口下的细粒度动作含义。

这与普通 dense mixed training 有本质区别。后者会把相机控制、机械臂控制、手部控制全部混进同一条参数路径,结果很容易出现梯度冲突;Worldscape-MoE 则把异源监督从“互相拉扯的训练噪声”,变成“共同放大的世界知识”。简单说,它不是训练多个世界模型,也不是把多类数据硬塞进一个模型,而是在同一个 DiT 世界模型里同时建立共享世界路径和控制专用路径。

一句话概括:Worldscape-MoE 统一的不是动作格式,而是动作作用于世界之后的动态规律。



02 多类控制进一个世界


Worldscape-MoE 覆盖了当前具身世界模型中最典型的三类控制范式。第一类是 Locomotion,面向场景探索、空间导航和交互式世界漫游,控制信号通常是相机轨迹或局部视角变化;第二类是 Manipulation,面向机器人操作要求模型理解机械臂运动、物体接触和任务状态变化;第三类是 Action Map,面向第一人称手部交互,模型根据像素对齐的手关节动作图生成与手-物交互一致的未来视频。

这三类信号没有被粗暴压缩成一种通用 token,而是通过各自最合适的方式注入同一个 diffusion backbone:轨迹控制经由 Control Adapter 对齐到视频 latent 并融合进 patch-level video tokens;手部 action map 先编码为 latent control feature,再作为视觉条件注入;机械臂动作则通过 Action MLP 编码为紧凑动作嵌入,并沿 DiT 的 timestep modulation 路径影响生成动态。

这套设计的高明之处在于,每种动作保留自己的结构,进入模型后又共享同一个世界建模主干。轨迹仍然像轨迹,机械臂动作仍然像机械臂动作,手部 action map 仍然像手部 action map;真正被统一起来的,是它们共同指向的世界变化。



03 MoE不是堆参数,而是拆解控制冲突


很多人看到 MoE,第一反应可能是“是不是又靠专家数量扩大容量”。但 Worldscape-MoE 使用 MoE 的目的更明确:它要解决异源动作控制中的结构性冲突。论文将 DiT block 中的 FFN 替换为控制感知的 MoE-FFN,每层维护一个 shared expert 和多个 modality-specific experts。shared expert 对所有样本开放,用来积累通用世界动态;locomotion、manipulation、hand motion 等专属专家只在对应控制存在时参与计算,用来吸收控制接口中的专门语义。
路由机制也非常干净。模型根据样本拥有的控制信号构造 eligibility mask,共享专家永远可用,只有对应模态专家可被激活;不相关专家既不参与 forward,也不接收这类样本的梯度。这样,机械臂动作不会污染相机控制专家,手部 action map 也不会强行更新轨迹控制路径。Worldscape-MoE 不需要额外引入复杂的 load-balancing 辅助损失,而是让控制类型本身决定专家可见性,再由端到端训练学习共享与专属之间的分工。
专家负载分析也证明了这个分解是有意义的:共享专家承担了约 69.48% 的 gate-weighted computation,说明模型确实在沉淀跨控制世界知识;同时,不同专属专家的负载呈现明显差异,locomotion 为 20.91%,manipulation 为 47.95%,hand motion 为 35.97%。这很符合直觉:相机轨迹更多依赖通用时空先验,而机械臂和手部交互对接触、遮挡、局部动作语义要求更高,因此需要更强的专属计算。


04 WorldScape-MoE Tuning

如果每新增一种控制信号都要重新训练一个世界模型,那么世界模型就很难真正成为基础设施。Worldscape-MoE 进一步提出 Worldscape-MoE Tuning,将异源控制扩展变成一个渐进式过程:先从预训练视频生成模型出发,接入相机控制和机械臂控制,建立稳定生成先验、空间轨迹控制和基础具身操作能力;随后逐步加入新的控制模态和对应专家。

这里有一个很关键的设计:新专家不是随机初始化,而是从当前 shared expert 初始化。这意味着新控制分支一开始就继承了模型已经学到的世界常识,再在自己的控制接口上做专门化。同时,训练采用 grouped learning-rate 策略,shared expert 和预训练继承参数使用更保守的学习率,新加入或强模态相关模块使用更高学习率,从而避免新模态冲掉已有世界知识。

这让世界模型的扩展方式发生变化:过去是“为每种控制重新造一个模型”,现在是“往同一个世界里接入一种新控制”。未来无论加入单臂机器人、灵巧手、移动底盘、全身 humanoid 动作,还是触觉、力反馈、工具轨迹等更复杂监督,都可以沿着这一路径继续扩展。实验证明,多专家的混合训练使得单个专家也能取得最优性能,Worldscape-MoE在通用世界模型权威评测榜单长期占据榜首位置。



05 强泛化能力与跨控制组合


Worldscape-MoE 的另一个亮点是 out-of-distribution (OOD)generalization 和 loco-manipulation。论文展示了模型在三类运动域上的 OOD 表现:它能在视觉分布变化很大的场景中保持相机运动一致性;能把模拟器中的机器人操作泛化到更真实的家具服务场景;也能把手部控制迁移到未见过的第一人称交互环境。这说明共享专家并不是简单记忆训练分布,而是在学习可复用的场景动态和物理规律。

更有想象空间的是 loco-manipulation。过去,移动和操作往往对应两个模型、两类数据、两套控制接口;Worldscape-MoE 将它们放进一个共享世界表示之后,模型开始能够生成耦合的移动-操作行为。对于未来具身 Agent 来说,这一点非常关键:真实任务不会只包含一种动作,智能体需要走到桌边、调整视角、伸手拿起物体、避开障碍并继续完成任务,而这些动作都发生在同一个连续世界中。

从这个角度看,Worldscape-MoE 的意义不只是“支持了三种控制”,而是开始把原本割裂的控制能力重新放回同一个世界里。世界模型只有同时理解“我怎么移动”和“我怎么操作”,才可能成为真正服务具身智能的内部模拟器。


Worldscape-MoE: A Unified Mixture-of-Experts World Model for Scalable Heterogeneous Action Control


https://worldscape-moe.com




--推荐阅读--


【声明】内容源于网络
0
0
Manifold AI流形空间
基于自研的世界模型构建具有通用理解和交互能力的具身智能体。
内容 16
粉丝 0
Manifold AI流形空间 基于自研的世界模型构建具有通用理解和交互能力的具身智能体。
总阅读96
粉丝0
内容16