WAIC(世界人工智能大会)大家是不是看了很多机器人?有的是预编程(为你跳支舞),有的是反应式(看到你就stop),有的会自主推理,但是不是有那么点……短!那么想机器人长时间聪明就非常需要世界模型,so~世界模型仅仅预测“动作之后会发生什么”还不够,还要记住此前做过什么、任务到了哪一步,并持续判断下一步。
现有 World Action Model(世界动作模型)大多只依赖当前观测或短时窗口。面对整理桌面、折叠衣物、制作咖啡等长程任务,模型容易遗忘进度、重复动作。同时,现有 WAM 大多局限于文本控制(language prompt),难以进行目标图片(image prompt)和示范视频(video prompt)等多模态prompt实时交互推理。
为此,Manifold AI 流形空间推出 WorldScape Policy 2.0,通过构建推理增强的长短期记忆,使得模型同时具备自主推理和多模态prompt实时交互推理能力。
▲ 图:不同 World Action Model 范式对比
现有 WAM 从单帧、短时窗口逐步扩展到完整历史;WorldScape Policy 2.0 进一步引入进度感知记忆、隐式子目标推理与多模态控制。
WorldScape Policy 2.0 的核心,不是简单把更多历史帧塞进模型,而是用短期视觉记忆保留局部动态,用长期事件记忆追踪任务进度,再把检索到的历史转化为下一步动作的隐式子目标。
|
|
同一个模型同时支持高层任务自主推理和细粒度文本控制(language prompt)、目标图片控制(image prompt)、视频示范(video prompt)等多模态实时交互推理。 |
|
|
构建近 500 万事件片段,对齐动作轨迹、高层任务、细粒度子任务、目标图片与视频示范,为可控 WAM 提供规模化预训练基础。 |
核心 Insight:
记忆不是越长越好,而是要理解任务进度
长时程操作的难点,往往不是看不清当前画面,而是不同任务阶段在视觉上高度相似。真正决定下一步动作的,是哪些子任务已经完成、当前处于哪个事件,以及历史中是否出现过关键状态转折。
因此,WorldScape Policy 2.0 将记忆拆成两个互补层次:
o
短期视觉记忆:
保留最近的视觉片段,追踪接触、运动与局部交互;
o
长期事件记忆:
组织历史 VLM 输出,检索与当前任务阶段相关的语义证据;
o
隐式子目标推理:
融合当前观测、任务指令与历史记忆,形成下一步动作条件。
▲ 图:推理增强长短期记忆
短期视觉记忆负责“刚刚发生了什么”,长期事件记忆负责“任务已经推进到哪里”,两者共同决定下一步动作。
长期事件记忆并非未经整理的历史序列。Global-History 汇总完整轨迹,Local-Active 保留当前事件的细节,Event-Boundary 捕捉子任务切换时的关键状态。模型检索相关历史后,再通过门控机制控制记忆注入,减少无关信息干扰。
简单说,模型不仅“看过历史”,还会围绕任务进度组织和使用历史。
一套模型:
统一自主推理和多模态prompt交互推理
▲ 图:WorldScape Policy 2.0 总体框架
文本、目标图片和视频示范进入统一的因果视频—动作建模流程,长期事件记忆与短期视觉记忆共同服务于动作和未来视觉预测。
WorldScape Policy 2.0 使用共享的因果 video-action DiT,联合预测未来视觉与机器人动作。不同意图通过各自适合的路径进入模型:
o
层任务指令由 VLM 结合当前观测和事件记忆解释,用于自主规划;
o
细粒度文本指令由 T5 编码,直接控制当前原子动作;
o
目标图片与视频示范作为持续视觉上下文,在整个执行过程中保持可见;
o
不同机器人形态使用独立动作适配器,同时共享视频—动作主干。
这里的关键连接是 Semantic Forcing。
训练时,事件级细粒度文本充当语义目标,与记忆增强后的 VLM 规划表示对齐。推理时,即使没有显式步骤,模型也能根据高层任务、当前观测和历史进度恢复当前子目标。
细粒度文本在训练阶段充当“语义老师”,把明确的原子动作含义迁移给自主规划路径。
这使同一个模型具备两种推理模式:
o
Autonomous Mode:
只输入高层任务,由模型自主拆解并推进任务规划与动作执行;
o
Interactive Mode:
输入细粒度文本(language prompt)、目标图片(image prompt)或视频示范(video prompt),精确控制模型执行相应动作。
ManipEvent-5M:
把长轨迹变成可学习的事件
现有具身数据常用一句指令标注整条轨迹,使不同原子动作共享同一文本标签。ManipEvent-5M 将长轨迹拆解为具有明确起止状态的事件,同时保留全局任务与局部动作语义。
▲ 图:ManipEvent-5M 构建流程
异构人类与机器人数据经过动作统一、事件切分、分层描述和多模态提示构建,形成事件级训练样本。
数据覆盖真实机器人、仿真轨迹、无本体 UMI 与第一视角人类视频等多种来源。
ManipEvent-5M数据组成:
o
512.14M 视频帧、4,982.81小时数据;
o
744.43K 条 episode、4.89M 个事件片段;
o
平均每条 episode 包含 6.6 个事件。
每个事件片段同时对齐动作轨迹、全局任务指令、事件级细粒度描述、目标图片和视频示范。
▲ 图:ManipEvent-5M 分层标注示例
同一条长任务同时具有全局任务描述、事件边界,以及与局部动作严格对齐的细粒度 caption。
除文本外,ManipEvent-5M 还构造机器人第一视角与第三视角目标图片,并配对跨形态视频示范,让模型学习目标状态、物体对应关系与可迁移动作规律。
▲ 图:ManipEvent-5M 多模态提示样例
长时程咖啡制作样例:全局任务、当前观测、目标图片、事件级指令和跨形态视频示范被组织在同一个训练接口中。
三阶段训练:
先学会控制,再学会自主规划
WorldScape Policy 2.0 通过三阶段课程逐步建立可控性、记忆和推理。
Stage 1|
Event-Grounded Multimodal WAM Pretraining
在 ManipEvent-5M 上学习细粒度语言—视频—动作对齐和多模态控制,同时建立短期视觉记忆。
Stage 2|
Memory-Aware Mid-Training
加入 VLM 规划分支、长期事件记忆和 Semantic Forcing,学习从高层任务与历史进度中推断当前子目标。
Stage 3|
Downstream Interactive Post-Training
适配下游机器人形态与任务分布,同时保留自主规划、细粒度控制和视觉提示适应能力。
这套训练顺序的意义在于:先建立稳定、可控的原子动作能力,再把这些能力迁移到需要记忆与推理的自主规划路径中。
强泛化能力与多模态控制:
从仿真走向真机实战评测
仿真评测:RoboTwin 2.0领先表现
在 RoboTwin 2.0 的 50 个双臂任务上测试 Clean 与 Randomized 两种设置,每个任务评测 100 次。
▲ 表:主流VLA和WAM仿真评测结果对比
WorldScape Policy 2.0 在 Clean、Randomized 和平均成功率上分别达到 94.3%、94.2% 和 94.3%,取得领先的综合表现。
真机评测:从自主规划到多模态prompt交互
双臂 PiPER 评测覆盖衣物与纸箱折叠、Shell Game、跨形态积木堆叠和细粒度桌面清理。每项任务测试 20 次。
▲ 图:双臂 PiPER 真机评测任务示意
▲ 图:真机评测任务成功率对比
o
自主规划:
衣物与纸箱折叠均达到 75%,相比两类基线最高分别提升 15 和 10 个百分点;
o
历史推理:
Shell Game 达到 75%,较 π0.5 和 DreamZero 分别提升 45 和 25 个百分点;
o
跨形态迁移:
目标图片(image prompt)与视频示范(video prompt)下分别达到 60% 和 70%,而两类基线最高仅为 20%;
o
细粒度控制:
完整桌面清理达到 80%;对未见物体的指令成功率达到 60.0%,均显著优于VLA和WAM的主流方法。
结果表明,WorldScape Policy 2.0 能够在真实场景中统一记忆、规划与多模态控制。在多模态prompt交互推理模式下对比现有方案具备压倒性优势。
WorldScape Policy 2.0 的价值不只是为 WAM 增加更长的上下文,它还把局部视觉动态、全局任务进度、隐式子目标推理和多模态意图统一到一个世界动作模型中,让机器人既能自主推理,也能接受多模态prompt进行实时交互。WAM 不再只是一个被动预测未来的模型,而开始成为能够记忆、推理并持续行动的机器人“强大脑”。
推荐阅读
RECOMMENDED READING
加入我们
JOIN US
探索下一代世界模型
扫码投递

