大数跨境

让机器人具备记忆和多模态prompt交互能力:Manifold AI 发布 WorldScape Policy 2.0世界动作模型

让机器人具备记忆和多模态prompt交互能力:Manifold AI 发布 WorldScape Policy 2.0世界动作模型 Manifold AI流形空间
2026-07-21
8
导读:只会文字prompt?NO!Manifold AI 发布 WorldScape Policy 2.0世界动作模型,让机器人具备记忆和多模态prompt交互能力。

WAIC(世界人工智能大会)大家是不是看了很多机器人?有的是预编程(为你跳支舞),有的是反应式(看到你就stop),有的会自主推理,但是不是有那么点……短!那么想机器人长时间聪明就非常需要世界模型,so~世界模型仅仅预测“动作之后会发生什么”还不够,还要记住此前做过什么、任务到了哪一步,并持续判断下一步。

现有 World Action Model(世界动作模型)大多只依赖当前观测或短时窗口。面对整理桌面、折叠衣物、制作咖啡等长程任务,模型容易遗忘进度、重复动作。同时,现有 WAM 大多局限于文本控制(language prompt),难以进行目标图片(image prompt)和示范视频(video prompt)等多模态prompt实时交互推理。



为此,Manifold AI 流形空间推出 WorldScape Policy 2.0,通过构建推理增强的长短期记忆,使得模型同时具备自主推理和多模态prompt实时交互推理能力。


▲ 图:不同 World Action Model 范式对比


现有 WAM 从单帧、短时窗口逐步扩展到完整历史;WorldScape Policy 2.0 进一步引入进度感知记忆、隐式子目标推理与多模态控制。

WorldScape Policy 2.0 的核心,不是简单把更多历史帧塞进模型,而是用短期视觉记忆保留局部动态,用长期事件记忆追踪任务进度,再把检索到的历史转化为下一步动作的隐式子目标。




01

推理增强的长短期记忆


_

统一短期视觉动态、长期事件进度与隐式子目标推理,使机器人能够从高层指令出发进行长时程自主规划。

02

统一自主推理和多模态prompt实时交互推理


_

同一个模型同时支持高层任务自主推理和细粒度文本控制(language prompt)、目标图片控制(image prompt)、视频示范(video prompt)等多模态实时交互推理。

03

ManipEvent-5M 事件级多模态数据


_

构建近 500 万事件片段,对齐动作轨迹、高层任务、细粒度子任务、目标图片与视频示范,为可控 WAM 提供规模化预训练基础。



核心 Insight:

记忆不是越长越好,而是要理解任务进度


长时程操作的难点,往往不是看不清当前画面,而是不同任务阶段在视觉上高度相似。真正决定下一步动作的,是哪些子任务已经完成、当前处于哪个事件,以及历史中是否出现过关键状态转折。

因此,WorldScape Policy 2.0 将记忆拆成两个互补层次:

o

短期视觉记忆:

保留最近的视觉片段,追踪接触、运动与局部交互;

o

长期事件记忆:

组织历史 VLM 输出,检索与当前任务阶段相关的语义证据;

o

隐式子目标推理:

融合当前观测、任务指令与历史记忆,形成下一步动作条件。


▲ 图:推理增强长短期记忆


短期视觉记忆负责“刚刚发生了什么”,长期事件记忆负责“任务已经推进到哪里”,两者共同决定下一步动作。

长期事件记忆并非未经整理的历史序列。Global-History 汇总完整轨迹,Local-Active 保留当前事件的细节,Event-Boundary 捕捉子任务切换时的关键状态。模型检索相关历史后,再通过门控机制控制记忆注入,减少无关信息干扰。

简单说,模型不仅“看过历史”,还会围绕任务进度组织和使用历史。



一套模型:

统一自主推理和多模态prompt交互推理


▲ 图:WorldScape Policy 2.0 总体框架


文本、目标图片和视频示范进入统一的因果视频—动作建模流程,长期事件记忆与短期视觉记忆共同服务于动作和未来视觉预测。

WorldScape Policy 2.0 使用共享的因果 video-action DiT,联合预测未来视觉与机器人动作。不同意图通过各自适合的路径进入模型:


o

层任务指令由 VLM 结合当前观测和事件记忆解释,用于自主规划;

o

细粒度文本指令由 T5 编码,直接控制当前原子动作;

o

目标图片与视频示范作为持续视觉上下文,在整个执行过程中保持可见;

o

不同机器人形态使用独立动作适配器,同时共享视频—动作主干。


这里的关键连接是 Semantic Forcing

训练时,事件级细粒度文本充当语义目标,与记忆增强后的 VLM 规划表示对齐。推理时,即使没有显式步骤,模型也能根据高层任务、当前观测和历史进度恢复当前子目标。

细粒度文本在训练阶段充当“语义老师”,把明确的原子动作含义迁移给自主规划路径。

这使同一个模型具备两种推理模式:

o

Autonomous Mode:

只输入高层任务,由模型自主拆解并推进任务规划与动作执行;

o

Interactive Mode:

输入细粒度文本(language prompt)、目标图片(image prompt)或视频示范(video prompt),精确控制模型执行相应动作。



ManipEvent-5M:

把长轨迹变成可学习的事件


现有具身数据常用一句指令标注整条轨迹,使不同原子动作共享同一文本标签。ManipEvent-5M 将长轨迹拆解为具有明确起止状态的事件,同时保留全局任务与局部动作语义。


▲ 图:ManipEvent-5M 构建流程


异构人类与机器人数据经过动作统一、事件切分、分层描述和多模态提示构建,形成事件级训练样本。

数据覆盖真实机器人、仿真轨迹、无本体 UMI 与第一视角人类视频等多种来源。

ManipEvent-5M数据组成:

o

512.14M 视频帧、4,982.81小时数据;

o

744.43K 条 episode、4.89M 个事件片段;

o

平均每条 episode 包含 6.6 个事件。

每个事件片段同时对齐动作轨迹、全局任务指令、事件级细粒度描述、目标图片和视频示范。


▲ 图:ManipEvent-5M 分层标注示例


同一条长任务同时具有全局任务描述、事件边界,以及与局部动作严格对齐的细粒度 caption。

除文本外,ManipEvent-5M 还构造机器人第一视角与第三视角目标图片,并配对跨形态视频示范,让模型学习目标状态、物体对应关系与可迁移动作规律。


▲ 图:ManipEvent-5M 多模态提示样例


长时程咖啡制作样例:全局任务、当前观测、目标图片、事件级指令和跨形态视频示范被组织在同一个训练接口中。



三阶段训练:

先学会控制,再学会自主规划


WorldScape Policy 2.0 通过三阶段课程逐步建立可控性、记忆和推理。


Stage 1|

Event-Grounded Multimodal WAM Pretraining

在 ManipEvent-5M 上学习细粒度语言—视频—动作对齐和多模态控制,同时建立短期视觉记忆。

Stage 2|

Memory-Aware Mid-Training

加入 VLM 规划分支、长期事件记忆和 Semantic Forcing,学习从高层任务与历史进度中推断当前子目标。

Stage 3|

Downstream Interactive Post-Training

适配下游机器人形态与任务分布,同时保留自主规划、细粒度控制和视觉提示适应能力。


这套训练顺序的意义在于:先建立稳定、可控的原子动作能力,再把这些能力迁移到需要记忆与推理的自主规划路径中。



强泛化能力与多模态控制:

从仿真走向真机实战评测


仿真评测:RoboTwin 2.0领先表现

在 RoboTwin 2.0 的 50 个双臂任务上测试 Clean 与 Randomized 两种设置,每个任务评测 100 次。


 表:主流VLA和WAM仿真评测结果对比


WorldScape Policy 2.0 在 Clean、Randomized 和平均成功率上分别达到 94.3%、94.2% 和 94.3%,取得领先的综合表现。


真机评测:从自主规划到多模态prompt交互

双臂 PiPER 评测覆盖衣物与纸箱折叠、Shell Game、跨形态积木堆叠和细粒度桌面清理。每项任务测试 20 次。


▲ 图:双臂 PiPER 真机评测任务示意


▲ 图:真机评测任务成功率对比



o

自主规划:

衣物与纸箱折叠均达到 75%,相比两类基线最高分别提升 15 和 10 个百分点;

o

历史推理:

Shell Game 达到 75%,较 π0.5 和 DreamZero 分别提升 45 和 25 个百分点;

o

跨形态迁移:

目标图片(image prompt)与视频示范(video prompt)下分别达到 60%  70%,而两类基线最高仅为 20%;

o

细粒度控制:

完整桌面清理达到 80%;对未见物体的指令成功率达到 60.0%,均显著优于VLA和WAM的主流方法。


结果表明,WorldScape Policy 2.0 能够在真实场景中统一记忆、规划与多模态控制。在多模态prompt交互推理模式下对比现有方案具备压倒性优势。



结语

WorldScape Policy 2.0 的价值不只是为 WAM 增加更长的上下文,它还把局部视觉动态、全局任务进度、隐式子目标推理和多模态意图统一到一个世界动作模型中,让机器人既能自主推理,也能接受多模态prompt进行实时交互。WAM 不再只是一个被动预测未来的模型,而开始成为能够记忆、推理并持续行动的机器人“强大脑”。


WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory


https://manifoldai-research.github.io/WorldScape-Policy/


代码与模型将陆续开放,欢迎关注 WorldScape Policy 2.0 的后续进展。





推荐阅读

RECOMMENDED READING





加入我们

JOIN US


探索下一代世界模型

扫码投递



【声明】内容源于网络
0
0
Manifold AI流形空间
基于自研的世界模型构建具有通用理解和交互能力的具身智能体。
内容 16
粉丝 0
Manifold AI流形空间 基于自研的世界模型构建具有通用理解和交互能力的具身智能体。
总阅读96
粉丝0
内容16