5 个关键问题 Q&A
Q1:现有世界动作模型 (WAM) 做移动机器人操作存在哪三大核心瓶颈?
A:1. 时序粒度错配:WAM 按粗视频块建模,丢失抓取、接触等帧级精细动力学,无法支撑逐帧高精度控制;2. 动作结构错配:底盘低频移动、机械臂高频操作耦合在同一动作空间,梯度互相干扰,两类任务都难以优化;3. 训练推理分布错配:训练使用真实标注画面,推理只能用模型自己生成带噪、失真画面,暴露偏差导致长时序误差持续累积、任务失败。
Q2:ABot-M0.5 通过哪三项核心创新分别解决三大瓶颈?
A:1. 针对时序错配:引入帧级中间隐动作,构建「视频隐变量 - 隐动作 - 底层控制」三级分层生成,提取硬件无关精细运动意图;2. 针对动作耦合:设计双层混合 Transformer (D-MoT),模态区分三类 Token,动作层面拆分底盘、机械臂独立子塔,共享注意力保证协同;3. 针对训练推理偏移:提出梦境强制训练,两阶段前向传播先用模型生成虚拟画面,再基于失真梦境画面训练动作预测,对齐训练、推理输入分布。
Q3:梦境强制(Dream Forcing)的训练流程是什么,相比教师强制、扩散强制优势在哪?
A:流程分两阶段:阶段 A 并行生成模型自预测(梦境)视频 / 隐动作;阶段 B 用梦境隐变量作为条件预测机器人动作。优势:教师强制全程用干净真实画面,推理无真实画面时性能暴跌;扩散强制训练、推理噪声采样逻辑不一致,优化难度大。梦境强制训练输入与推理输入完全同源,让模型提前学会补偿自身视觉预测误差,长时序鲁棒性大幅提升。
Q4:模型完整三阶段训练流水线分别起到什么作用?
A:1. 预训练阶段:基于海量多源机器人数据预训练世界模型,搭建多相机统一表征;用 ALAM 框架自监督训练隐动作编码器,从无标注视频提取运动先验;2. SFT1(教师强制微调):使用真实视觉标注稳定世界、动作模型适配下游数据集,避免早期视觉噪声干扰收敛;3. SFT2(梦境强制微调):切换为模型自生成梦境画面训练,消除训练推理鸿沟,适配真实部署的自回归推演场景。
Q5:实验能证明 ABot-M0.5 的有效性有哪些关键证据?
A:1. 仿真基准:在 RoboCasa365 移动任务、LIBERO 桌面操作、RoboTwin 双臂任务全部超越 VLA、传统 WAM 基线,长时序未见复合任务提升最明显;2. 真实机器人:6 自由度单臂完成插销、插花、摆盘等精细 / 长时序任务,成功率、过程完整度显著优于 π0.5、Fast-WAM;3. 消融实验:移除隐动作、解耦 Transformer、梦境强制任一模块,性能大幅下降,证明三大创新缺一不可;4. 小样本验证:大规模预训练相比直接微调,任务成功率提升 31.2%,预训练具备极强迁移价值。
ABot-M0.5:面向移动操作的统一世界动作模型
阿里巴巴高德地图计算机视觉实验室
摘要
移动操作是通用机器人的核心能力,但现有具身学习方法在该任务上仍存在诸多挑战。视觉语言动作(VLA)策略大多属于反应式模型,缺少显式世界建模能力;而现有的世界动作模型(WAM)与移动操作任务的结构适配性较差:它们基于粗粒度视频块建模,将导航与操作动作耦合建模,且逆动力学训练的监督方式与自回归推理流程不匹配。这导致模型容易丢失细粒度接触动力学特征、出现动作分布冲突,长时序推演过程中误差持续累积。
本文提出 ABot-M0.5 全新世界动作模型,核心设计思路是让移动操作任务在三个维度实现对齐:时间粒度对齐、动作空间对齐、训练 - 推理一致性对齐。
- 时间粒度对齐:
引入中间隐动作,捕捉局部视觉状态转移,作为视频隐变量与机器人硬件控制之间的过渡动作空间; - 动作空间对齐:
设计双层混合 Transformer 架构,解耦多模态表征与异构动作子空间(底盘移动、机械臂操作); - 推理条件对齐:
提出 “梦境强制” 训练策略,基于模型自生成视频渐进式训练逆动力学,大幅提升自回归预测阶段的训练推理一致性与鲁棒性。
在高难度移动操作、细粒度操作基准测试集上开展大量实验,结果表明:ABot-M0.5 在长时序任务成功率、细粒度控制精度上均达到当前最优水平。实验结论证明:粒度对齐、动作解耦、推理一致的世界动作建模思路对移动机器人任务至关重要。
发布日期:2026 年 7 月 1 日开源代码:https://github.com/amap-cvlab/ABot-Manipulation论文预印本编号:arXiv:2607.00678v1 [cs.CV] 2026 年 7 月 1 日
目录
-
引言 -
面向对齐的世界动作学习 2.1 问题定义 2.2 移动操作任务的核心瓶颈 -
ABot-M0.5 模型 3.1 整体架构与符号定义 3.2 中间隐动作建模 3.3 双层混合 Transformer 3.4 实现训练推理对齐预测的梦境强制机制 -
训练流程 4.1 预训练数据集 4.2 世界模型预训练 4.3 隐动作模型预训练 4.4 渐进式监督微调 4.5 高效结构化注意力与隐变量增强 -
实验 5.1 实验设置 5.2 移动操作任务核心实验结果 5.3 纯操作基准测试结果 5.4 消融实验 5.5 真实机器人实物实验 -
结论与未来工作 -
作者贡献
图 1 ABot-M0.5 整体概览
高德的ABot-M0.5 是一套实现粒度对齐、动作解耦、训练推理一致的移动操作世界动作模型。上方:三阶段训练流水线(预训练、微调阶段 1、微调阶段 2)逐步提升模型性能;最终梦境强制微调阶段(SFT2)利用模型自生成视频训练逆动力学,显著提升鲁棒性。左中:为解决结构不匹配问题,设计「视频→隐动作→机器人动作」三级流水线实现时间粒度对齐;双层架构解耦不同动作子空间(底盘移动、机械臂操作),框架可适配各类异构机器人硬件。右侧:模型在仿真基准(雷达图)与真实机器人移动操作任务(柱状图)上均取得 SOTA 效果。底部:真实机器人执行序列(插花、找烤面包机等任务),可完成长时序移动操作;蓝色、绿色分别区分导航阶段与物体操作阶段。
1 引言
移动操作是通用机器人的标志性能力:高性能具身智能体不仅要完成物体操作,还需要在杂乱环境中自主导航、维持长时序任务上下文,并在视角、场景动态持续变化的条件下完成精准交互 [24,32,60,74]。尽管近年来具身 AI 发展迅速,但现有具身学习范式仍无法满足该需求。
反应式视觉语言动作(VLA)策略缺少显式世界建模与长时序记忆能力 [4,5,29,53,54];而新兴的世界模型方法虽具备潜力,但其结构设计仍无法适配移动操作的任务需求 [3,20,21,73]。
核心瓶颈并非模型规模不足,而是现有世界动作学习方法与移动操作任务存在结构性不匹配。高性能移动操作任务需要在三个维度完成对齐:
- 时间粒度对齐
:粗粒度视频预测最终需要支撑逐帧细粒度控制;若二者粒度不匹配,抓取闭合、接触触发、姿态微调等关键细微动力学特征会被模糊、丢失 [21]。 - 动作空间对齐
:导航与物体操作遵循完全不同的动力学规律 —— 底盘全局运动低频平滑,机械臂局部操作高频且对接触动力学高度敏感;若将二者耦合在单一动作空间优化,会出现梯度相互干扰、子任务优化效果次优的问题 [5,6]。 - 训练 - 推理一致性对齐
:模型部署推理时,动作预测依赖自身生成的未来观测,而非真实标注观测;训练与推理输入分布不一致会产生分布偏移,长时序自回归推演中误差持续累积,最终任务失败 [20,21,33,73]。
本文 ABot-M0.5 基于对齐原则设计,并非通过零散模块修补上述缺陷,而是提供一套统一的面向对齐的移动操作世界动作学习框架。
-
针对时间粒度不匹配:在视频隐变量与机器人控制之间引入帧级隐动作作为中间表征,将视频到动作的直接映射拆解为「视频→隐动作→硬件控制」三级流水线,模型可从粗粒度视觉动态中提取运动意图,再转化为可执行底层控制; -
针对动作结构不匹配:双层混合 Transformer 架构,同时解耦多模态表征、异构动作子空间,底盘运动与机械臂操作可在统一框架内独立建模; -
针对推理条件不匹配:提出梦境强制训练策略,让逆动力学学习基于模型自生成的预测视频,直接对齐训练与推理阶段的输入条件,提升模型对预测误差的鲁棒性。
在高难度移动操作、纯操作基准上开展大量实验,证明 ABot-M0.5 在长时序任务、细粒度操作任务上均取得显著性能提升。实验结果表明,移动操作性能提升不能仅依靠扩大模型规模、扩充数据量,更需要将世界建模、动作抽象、部署推理行为统一到一套自洽框架中 [44]。更广泛地说,本文为世界动作模型从固定机械臂操作拓展至移动机器人操作提供了可行方案。
本文核心贡献总结如下:
-
明确现有世界动作模型应用于移动操作时存在三大结构性瓶颈:粗粒度视频预测与细粒度控制的时间粒度不匹配、底盘移动与机械臂操作异构行为的动作结构不匹配、训练标注观测与自回归推理预测观测的上下文不匹配; -
提出面向移动操作的全新世界动作模型 ABot-M0.5,通过中间隐动作、双层混合 Transformer、梦境强制三大模块分别解决上述瓶颈,实现细粒度运动抽象、结构化动作解耦、训练推理一致的逆动力学学习; -
在多套高难度移动 / 纯操作基准上验证模型性能,在长时序任务成功率、细粒度操作精度上实现 SOTA;通过完备消融实验验证每个核心模块的独立增益。
2 面向对齐的世界动作学习
本章将移动操作形式化为一套需要对齐的世界动作学习问题。本文不将移动操作简单视作固定机械臂长时序任务的延伸,而是认为:世界建模、动作建模、部署推演三者必须协同对齐。该视角可统一解释现有具身学习方法在移动操作任务上表现不佳的根源,同时为下一章 ABot-M0.5 的架构设计提供理论依据。
2.1 问题定义
本文研究语言条件下的移动操作任务:机器人需要在视觉复杂环境中联合完成导航、物体交互,执行长时序连续行为 [32,60,74]。
在每一个时间步 t,智能体接收语言指令l、多视角视觉观测\(o_t\),以及可选的历史观测、历史动作序列。目标是生成底层可执行动作\(a_t\),在长时序范围内完成任务,同时动作序列与环境未来演化逻辑自洽。
形式化定义:\(o_t=\{I_t^{(1)},...,I_t^{(N_c)}\}\)代表 t 时刻多视角观测,\(N_c\)为相机数量,\(I_t^{(i)}\)为第 i 台相机拍摄图像。给定历史观测\(o_{\leq t}\)、历史动作\(a_{<t}\)、语言指令l,策略需要预测长度为H的未来行为序列。
传统反应式策略将该任务建模为固定窗口H内的条件映射 [4,6,10,29]:\(a_{t:t+H-1}\sim \pi (\cdot | o_{\leq t},a_{<t},l) \tag{1}\)该建模方式适合短时序、决策仅依赖当前观测的场景;但在移动操作任务中,未来决策不仅依赖当前状态,还取决于机器人自身动作引发的环境变化,因此反应式策略鲁棒性极差。
世界动作模型(WAM)通过联合建模未来观测、未来动作解决该缺陷 [3,33,71,73,76]。设\(z_{t+1:t+H}\)为未来时序观测压缩后的视频隐变量,WAM 不再直接从当前观测预测动作,而是建模结构化未来轨迹:\((z_{t+1:t+H},a_{t:t+H-1})\sim p(\cdot | o_{\leq t},a_{<t},l) \tag{2}\)该形式引入显式环境未来建模,天然适配长时序推演,未来视觉预测、动作预测整合在同一套自回归流程中。
但直接将现有 WAM 应用于移动操作仍存在缺陷。移动操作与固定机械臂操作至少存在三点本质差异:
-
机器人自主移动带来更大视角变化、更多样场景切换,环境未来演化范围更广; -
动作空间异构:同一策略需要同时生成底盘移动、机械臂操作两类完全不同的控制信号; -
推演鲁棒性要求更高:长时序移动任务会持续放大微小预测误差,最终导致任务崩溃。
以上差异说明:不能将移动操作简单视作 “更大规模的固定机械臂任务”,而应视作一套对表征、控制、推演流程有严格结构约束的世界动作学习问题。
移动操作的核心难点在于打通两类完全割裂的表征空间:一是捕捉全局环境演化、粗粒度长时序视频隐变量\(z_{t+1:t+H}\);二是细粒度、异构的机器人可执行动作\(a_{t:t+H-1}\)。直接将视频隐变量映射到底层控制存在严重粒度、语义鸿沟。
为简化后文符号,下文统一省略时序窗口H,将\(z_{t+1:t+H}\)、\(a_{t:t+H-1}\)简写为\(z_{t+1}\)、\(a_t\)。
理想的移动操作策略应当学习一套分层连贯的推理流程:先预测视觉环境演化\(z_{t+1}\),再将宏观演化信息提炼为帧级中间运动意图(捕捉局部视觉状态变化),最终将意图映射为适配硬件的底层控制\(a_t\)。分层流程可形式化为:\(视频隐变量z_{t+1} \to \underbrace{帧级运动意图输入}_{过渡表征空间} \to 机器人动作a_t \tag{3}\)中间过渡表征是连接全局环境动力学与细粒度物理执行的关键桥梁。但如何定义、训练、对齐该中间表征,仍是未解决的开放问题。本章后续将通过引入隐动作实例化该过渡空间,并配套定制架构、训练策略实现全维度对齐。
2.2 移动操作的三大核心瓶颈
基于上述形式化推导,现有方法的核心缺陷并非模型容量不足,而是世界动作模型的训练逻辑与移动操作任务结构不匹配 [3,73,76]。本文归纳三大结构性瓶颈:
瓶颈 1:时间粒度不匹配
现有 WAM 通常采用时序压缩块建模未来观测,该设计计算高效,适合长视频预测,但造成世界建模、动作生成二者时间粒度割裂。实际场景中,视频隐变量一个块会聚合多帧画面,而机器人控制需要逐帧输出动作。该粒度冲突对移动操作影响极大:抓取闭合、接触触发、物体释放、精准对位、局部避障等行为均发生在极短时间窗口;若世界建模仅在粗粒度块级别执行,局部关键状态变化会被平滑、丢失,模型无法还原执行所需的精准运动意图。
瓶颈 2:动作结构不匹配
移动操作引入异构动作空间,与固定机械臂任务完全不同:机器人需要同时控制全局底盘、局部机械臂,两类行为动力学规律差异巨大。底盘运动低频、平滑、面向全局;机械臂操作高频、局部,对接触动力学极度敏感。若将二者耦合在单一动作空间联合优化,会产生两大负面影响:
-
优化难度提升:以移动为主、以操作为主的轨迹梯度相互干扰,模型无法针对两类行为分别专精; -
组合性变差:多数移动操作任务要求底盘、机械臂协同运动,但二者结构特征被融合,无法独立解耦推理。
瓶颈 3:推演条件不匹配
第三大瓶颈来自逆动力学训练、推理阶段输入条件不一致。训练阶段:逆动力学模型以真实标注未来观测 / 隐变量作为条件输入;推理阶段:无法获取真实未来观测,模型必须基于自身生成的视觉推演结果做决策;自生成预测必然存在噪声、不确定性、严重失真(画面模糊、物体漂移、幻觉内容)。
该训练 - 推理分布偏移会带来世界动作学习中的暴露偏差,与序列预测、模仿学习领域的分布偏移问题同源 [2,56]。逆动力学模型在理想标注数据下完成优化,部署时却要基于失真预测画面输出动作;长时序移动操作中,该偏差持续累积,最终导致任务执行失败。
小结
三大瓶颈存在统一内在逻辑:现有方法与移动操作任务结构对齐不足。粗粒度视觉预测与精细控制不匹配、耦合动作学习与异构机器人行为不匹配、基于真实标注的训练与自回归部署不匹配。ABot-M0.5 完全基于该核心洞察设计,下一章将完整介绍模型架构:通过隐动作解决时间粒度不匹配、双层混合 Transformer 实现结构化动作建模、梦境强制机制解决推演对齐的逆动力学学习问题。
3 ABot-M0.5 模型
本章详细介绍 ABot-M0.5 完整架构。基于第二章提出的对齐设计思路,模型针对性解决移动操作三大结构性瓶颈:时间粒度不匹配、动作结构不匹配、训练推理条件不匹配。宏观层面,ABot-M0.5 将世界动作学习拆解为分层级联流程:先预测未来视觉动力学,再提炼帧级运动意图,最后生成适配硬件的可执行动作。
3.1 整体架构与符号定义
表 1 ABot-M0.5 核心符号对照表
ABot-M0.5 是基于 Wan2.2 视频扩散主干 [66] 构建的视频 - 动作世界动作模型。给定语言指令l、多视角观测序列,模型在统一生成框架内联合建模未来视频隐变量、帧级隐动作、机器人可执行动作。
感知阶段:3D 变分自编码器将连续视频观测\(o_t=\{I_t^{(1)},...,I_t^{(N_c)}\}\)压缩为紧凑时空视频隐变量\(z_t\);文本编码器(如 UMT5)将语言指令l映射为条件特征。核心创新:引入帧级隐动作\(m_t\)捕捉局部视觉状态转移,作为粗粒度视频隐变量与细粒度底层控制之间的过渡表征。完整生成流程遵循结构化级联关系(无噪声干净变量):\(z_{t+1} \to m_t \to a_t \tag{4}\)\(z_{t+1}\)、\(m_t\)、\(a_t\)分别代表干净未来视频隐变量、干净隐动作、干净可执行动作。该分层拆解将直接视频到动作预测拆分为三个独立阶段:环境世界建模、运动意图抽象、底层控制生成。
本文采用条件流匹配(CFM)作为全流程统一生成优化目标。以第一阶段世界建模为例:给定真实干净视频隐变量\(z_{t+1}\)、标准高斯噪声\(\epsilon \sim \mathcal{N}(0,I)\),在均匀采样扩散步\(\tau \sim \mathcal{U}(0,1)\)构建条件概率路径。视频预测损失定义为:\(\mathcal{L}_{z}=\mathbb{E}_{z_{t+1}, \epsilon, \tau}\left[\left\| v_{\theta}^{z}\left(z_{t+1}^{\tau} ; z_{<t+1}, m_{<t}, a_{<t}, \tau, l\right)-\left(z_{t+1}-\epsilon\right)\right\| _{2}^{2}\right]\)其中\(z_{t+1}^{\tau}=\tau z_{t+1}+(1-\tau) \epsilon\)为插值中间状态,\(v_{\theta}^{z}\)为预测速度场的网络。关键约束:\(z_{t+1}\)的条件输入仅包含历史状态\((z_{\leq t}, m_{<t}, a_{<t})\)与语言指令l。
后续隐动作\(m_t\)、动作\(a_t\)预测阶段采用形式一致的 CFM 损失,但条件输入会按级联生成顺序逐步扩充(例如预测\(m_t\)时,条件输入包含已预测的\(z_{t+1}\))。该数学设计保证训练阶段信息流动顺序与推理自回归生成顺序完全一致。
架构层面,模型并行处理三类 Token 流:\(X_{t}=\left[ X_{t+1}^{z},X_{t}^{m},X_{t}^{a}\right] \tag{6}\)\(X_{t+1}^{z}\)视频隐变量 Token、\(X_{t}^{m}\)隐动作 Token、\(X_{t}^{a}\)可执行动作 Token。为严格遵循级联流程的因果依赖,模型采用非对称信息流通约束:视频隐变量 Token 无法读取隐动作 Token(预测未来画面时,未来运动意图未知);反之动作 Token 可完整读取\(X_{t}^{m}\),保证底层控制基于细粒度运动意图生成。
为实现上述对齐逻辑,架构包含三大核心模块,下文分小节详细说明:
-
中间隐动作建模模块:解决世界建模与底层控制的时间粒度鸿沟; -
双层混合 Transformer(D-MoT):在保持模态统一优化的前提下,结构性解耦底盘移动、机械臂操作等异构动作子空间; -
梦境强制机制:让动作预测基于模型自生成视觉预测,从根源消除训练推理分布偏移。
3.2 中间隐动作建模
第二章 2.2 节已证明,直接将粗粒度视频隐变量映射到底层控制会产生严重时间、结构不匹配。为此 ABot-M0.5 引入帧级隐动作\(m_t\)作为与硬件无关的中间表征,将生成流程拆解为三级结构化级联:\(上下文信息 \xrightarrow{世界建模} z_{t+1} \xrightarrow{运动抽象} m_t \xrightarrow{控制解码} a_t \tag{7}\)流程拆解:阶段 1(世界建模):预测未来视频隐变量\(z_{t+1}\),捕捉宏观环境全局演化;阶段 2(运动抽象):将粗粒度环境动态提炼为帧级隐动作\(m_t\),表征细粒度运动意图;阶段 3(控制解码):将运动意图转化为适配机器人硬件的底层可执行动作\(a_t\)。
该分层设计将与硬件无关的物理先验、硬件专属运动学解耦,实现跨异构机器人平台的鲁棒泛化。
隐动作提取与对齐
隐动作仅依赖连续帧视觉状态变化,可从大规模无动作标注视频数据集提取,无需机器人运动学标签 [34,62,72]。给定连续两帧图像\((I_t,I_{t+1})\),使用冻结预训练隐动作编码器\(E_m\)提取局部运动表征:\(m_{t}=E_{m}\left(I_{t}, I_{t+1}\right) \in \mathbb {R}^{d_{m}} \tag{8}\)\(d_m\)为隐动作特征维度。多相机场景下,从每个视角分别提取隐动作,整合为统一时空张量。对于包含H个控制步、\(N_c\)个相机的时序块,聚合后隐动作张量结构为\(M=\{m_t^{view}\}\in \mathbb{R}^{H ×N_c ×d_m}\)。
该表征空间具备跨硬件对齐特性:无论机器人形态如何,同类物理交互(抓取物体)会映射至隐动作空间内邻近区域。该对齐特性是跨机器人平台迁移物理运动先验的基础。
基于条件流匹配的隐动作生成
本文将隐动作生成建模为条件流匹配(CFM)问题,该无仿真损失函数已广泛应用于连续动作机器人策略领域 [4,37,52,53]。
给定真实干净隐动作\(m_t\)、高斯噪声\(\epsilon \sim \mathcal{N}(0,I)\),扩散步\(\tau\sim \mathcal{U}(0,1)\),损失函数定义:\(\mathcal{L}_{m}=\mathbb{E}_{m_{t}, \epsilon, \tau}\left[\left\| v_{\theta}\left(m_{t}^{\tau} ; z_{\leq t+1}, m_{<t}, a_{<t}, \tau, l\right)-\left(m_{t}-\epsilon\right)\right\| _{2}^{2}\right] \tag{9}\)\(m_{t}^{\tau}=\tau m_{t}+(1-\tau) \epsilon\)为插值中间状态,\(v_{\theta}\)为预测速度场网络。该损失监督模型通过迭代去噪生成高保真隐动作;模型仅基于预期环境动态、视觉时序变化训练,可捕捉与硬件无关的细粒度运动意图,为下游控制解码器提供稳定引导。
3.3 双层混合 Transformer(D-MoT)
隐动作模块解决了世界建模与底层控制的时间粒度不匹配,但移动操作还需要针对性处理异构动作动力学。本文提出双层混合 Transformer 架构,分别在模态层、动作层两层实现异构表征解耦。
第一层:模态层级解耦
D-MoT 第一层针对三类并行 Token 流:视频隐变量\(X^z\)、隐动作\(X^m\)、可执行动作\(X^a\)。三类 Token 共享同一 Transformer 主干完成跨模态推理,但语义、时序作用完全不同。为避免表征坍缩,每种模态配备独立输入投影层、时间步嵌入层、输出预测头。该设计保证世界动态、运动意图、硬件控制维持独立表征空间,同时通过共享自注意力层实现灵活跨模态信息交互。
第二层:动作层级解耦
D-MoT 第二层仅作用于可执行动作 Token 流\(X^a\)。移动操作动作向量\(a_t\)天然包含底盘移动、机械臂操作两类维度,二者时序频率、损失曲面完全不同。若用单一输出头联合预测,高频机械臂信号会干扰、破坏低频底盘运动预测。
本文将动作空间\(a_t\)显式拆分为两个独立子空间:机械臂操作\(a_t^{manip}\)、底盘移动\(a_t^{move}\)。通道与子塔严格一一对应,每个子塔配备独立前馈网络(FFN)、预测输出头。各子塔专注学习专属动作空间,彻底分离底盘、机械臂的学习动力学。
结构化联合注意力
尽管前馈层完全解耦,模型仍需要支持移动、操作之间协同推理(例如底盘位移直接影响抓取可行性)。D-MoT 在每一层对拼接后的全部 Token 流执行统一自注意力;通过精心设计因果、条件掩码,隐动作、底盘动作、机械臂动作 Token 共享注意力计算,但后续 FFN 分支独立。在保证子空间专业化训练的同时,保留跨子空间协同推理能力。
子空间感知 CFM 监督
底层动作生成同样采用条件流匹配(CFM)监督。训练阶段采用教师强制上游条件输入,动作解码器接收真实标注视频隐变量\(z_{\leq k+1}\)、隐动作\(m_{\leq k}\)。同一块时序内带噪声动作互相可见,实现跨子空间协同。为保证训练推理一致性、提升推理效率,底盘、机械臂子空间共享同一去噪时间步,推理阶段并行同步去噪,无需两套独立噪声调度。
形式化定义:t 时刻模型基于上游真实标注表征、干净历史动作\(a_{<t}=\{a_j^{move},a_j^{manip}\}_{j<t}\)预测可执行动作。底盘、机械臂共享扩散步\(\tau\in[0,1]\),分别独立采样高斯噪声\(\epsilon^{move},\epsilon^{manip}\sim \mathcal{N}(0,I)\)。带噪声动作构造公式:\(a_{t}^{move,\tau }=\tau a_{t}^{move}+(1-\tau )\epsilon ^{move}, \quad a_{t}^{manip,\tau }=\tau a_{t}^{manip}+(1-\tau )\epsilon ^{manip} \tag{10}\)
两类分支 CFM 损失分别定义:\(\mathcal{L}_{a}^{move}=\mathbb{E}_{a_{t}^{move},\epsilon ^{move},\tau }\left[ \left\| v_{\theta }^{move}\left( a_{t}^{move,\tau };z_{\leq t+1},m_{\leq t},a_{<t},a_{t}^{manip,\tau },\tau ,l\right) -(a_{t}^{move}-\epsilon ^{move}\right) \| _{2}^{2}\right]\)\(\mathcal{L}_{a}^{manip}=\mathbb{E}_{a_{t}^{manip},\epsilon ^{manip},\tau }\left[ \left\lVert v_{\theta }^{manip}\left( a_{t}^{manip,\tau };z_{\leq t+1},m_{\leq t},a_{<t},a_{t}^{move,\tau },\tau ,l\right) -\left( a_{t}^{manip}-\epsilon ^{manip}\right) \right\rVert _{2}^{2}\right] \tag{12}\)每一分支将另一分支带噪声动作作为输入,实现跨子空间协同建模。整体动作损失为加权求和:\(\mathcal{L}_{a}=\lambda_{move } \mathcal{L}_{a}^{move }+\lambda_{manip } \mathcal{L}_{a}^{manip } \tag{13}\)\(\lambda_{move}\)、\(\lambda_{manip}\)平衡两类子空间损失权重。整套子空间感知 CFM 监督闭环完成\(z_{t+1} \to m_t \to a_t\)三级级联最后一环。动作去噪同时结合预期环境动态、细粒度运动意图,且保留跨子空间信息流通,输出时序连贯、物理合理的动作块。
3.4 梦境强制:实现训练推理对齐的动作预测
动作预测的训练 - 推理鸿沟
现有世界动作模型(WAM)主要两类训练范式:
- 教师强制范式
[17,33,50]:动作 Token 去噪时以干净真实标注视频隐变量为条件; - 扩散强制范式
[3,71,73]:视频、动作 Token 在统一扩散流程内联合去噪。
两种范式均存在严重训练推理鸿沟,对动作预测影响极大(见图 4):
-
教师强制(图 4a):训练时动作模型可读取干净真实未来视频隐变量;但推理阶段无真实标注,模型只能基于自身带误差的预测画面输出动作。该分布偏移造成严重暴露偏差:动作预测器从未学习如何解读、补偿自身生成的失真视觉画面,推理阶段性能大幅衰减。 -
扩散强制(图 4b):通过训练时输入带噪声视频隐变量部分缓解该问题,但引入新的分布不一致。训练时视频、动作 Token 独立随机采样噪声步;而推理阶段遵循固定去噪轨迹,训练、推理噪声步组合无法完全匹配。模型需要学习大量人工噪声配置下的动作预测,优化难度提升,训练推理分布鸿沟依然存在。
梦境强制(Dream Forcing)训练范式
本文提出全新梦境强制训练范式,直接对齐训练、推理阶段的条件输入。不再使用真实标注视频隐变量、随机噪声隐变量作为动作预测条件,而是将模型自身生成的预测视频隐变量作为训练输入(图 4c)。该设计让动作模型训练时接触与推理阶段同源的失真视觉画面,自主学习补偿模型预测误差的鲁棒动作生成逻辑,从根源缩小训练推理分布鸿沟。
两阶段前向传播执行方案
为实现梦境强制,本文放弃传统单轮前向传播联合优化多模态 Token 的方案,采用两阶段前向传播,分离 “生成梦境隐变量”、“优化动作预测” 两大流程。
- 阶段 A:并行梦境生成
:模型执行标准前向传播,预测速度场,输出干净自生成隐变量\(\hat{z}_{t+1}\)、\(\hat{m}_t\),作为阶段 B 的条件输入。与视频生成领域自强制串行多块推演不同,机器人闭环场景仅需生成最新时序块;历史块持续由真实观测锚定 [33],无需耗时串行推演。采用并行生成策略,单轮前向传播即可批量生成全部所需梦境隐变量。同时借鉴自强制方法 [22],采用少步去噪方案,平衡训练效率与生成质量。 - 阶段 B:梦境强制动作优化
:执行第二轮前向传播,基于阶段 A 生成的梦境隐变量预测最终动作\(\hat{a}_t\)。
该流程将动作预测条件分布从标准教师强制:\(a_{t}\sim p_{a}(\cdot | z_{\leq t+1},m_{\leq t},a_{<t},l) \tag{14}\)更新为本文梦境强制形式:\(a_{t}\sim p_{a}(\cdot | \hat {z}_{t+1},z_{\leq t},\hat {m}_{t},m_{<t},a_{<t},l) \tag{15}\)仅将未来条件隐变量\(z_{t+1}\)、\(m_t\)替换为模型自生成版本\(\hat{z}_{t+1}\)、\(\hat{m}_t\)。通过让动作预测模型持续在失真梦境视觉上下文下训练,梦境强制彻底消除训练推理分布鸿沟。
综上,ABot-M0.5 三大核心模块分工明确:中间隐动作建模打通世界建模与底层控制的时间鸿沟;双层混合 Transformer 解决模态、动作结构异构问题;梦境强制让逆动力学学习与自回归推演条件完全对齐。下一章完整介绍从大规模预训练到推理对齐微调的整套渐进式训练流程。
4 训练流程
为充分释放 ABot-M0.5 多模态生成、表征建模能力,本文采用渐进式训练流程:从大规模世界建模预训练,过渡到与推理流程对齐的动作微调。模型同时依赖未来视频预测、帧级隐动作抽象、可执行动作生成三类模块,因此不能直接在最难的推演场景下从头联合优化,必须分阶段建立各项基础能力。完整训练分为三大阶段:大规模世界模型预训练、隐动作自监督预训练、渐进式监督微调;同时配套系统级优化技术,支持长序列视频 - 动作高效训练。
4.1 预训练数据集
ABot-M0.5 预训练语料融合大规模公开机器人数据集、仿真机器人合成数据。目标是覆盖多样化机器人硬件、环境、任务结构、操作动力学,让模型在下游微调前习得可迁移通用先验。所有数据集统一标准化为一套数据格式,保证处理、训练、评估流程一致。基于前人 ABot 系列工作的数据流水线,聚合以下数据源:
-
OXE [11]:大规模多硬件机器人数据集,覆盖丰富场景、任务、机器人平台,提供基础具身行为多样性; -
OXE-AugE [25]:OXE 增强扩展数据集,提升单臂机器人硬件多样性; -
Agibot-Beta [1]:高质量结构化任务数据集,包含连贯长时序操作轨迹; -
RoboCOIN [69]:双臂操作、分层任务结构跨硬件数据集; -
RoboMind [68]:长短时序单 / 双臂操作数据集,跨平台多样性强; -
Galaxea [26]:包含丰富传感器信号、细分子任务标注的复杂长时序操作数据集,同时包含大量底盘移动协同任务; -
InternData-A1 [64]:仿真大规模合成机器人数据集,覆盖多样硬件、操作技能、场景布局。
数据集互补优势:OXE、OXE-AugE 提供数据规模与硬件多样性;Agibot-Beta、Galaxea 提供高质量长时序任务结构;RoboCOIN、RoboMind 丰富双臂、跨硬件场景;InternData-A1 补充仿真规模与场景多样性。额外引入 RoboNet [15]、BridgeData V2 [65]、DROID [27] 等公开机器人数据集,进一步提升泛化鲁棒性。
该数据流水线同样支持隐动作预训练:帧级隐动作仅依赖连续视觉帧对,无需运动控制标签,大量无标注、弱标注视频均可参与运动抽象学习,大幅拓宽预训练有效数据范围,突破仅带动作标注机器人数据集的局限。
4.2 世界模型预训练
训练第一阶段专注预训练框架内视觉世界模型主干。基于预训练 Wan2.2 5B 权重 [66] 初始化,以无动作条件的自回归未来视频预测任务做全参数微调,将互联网时空视觉先验适配机器人场景。
该阶段三大核心作用:
-
模型习得鲁棒场景、物体表征; -
提升未来隐变量预测质量,为后续动作预测提供高质量条件输入; -
视觉世界建模、逆动力学学习解耦,大幅降低下游微调训练难度。
多相机异构数据适配:固定语义槽分配
异构硬件数据集相机配置差异巨大,会造成视频生成模型空间表征学习混乱。本文提出固定语义槽分配策略:定义 4 个标准视频槽,预设语义分工:
-
前 2 个槽:第三人称全局视角,捕捉整体场景、机器人机身姿态; -
后 2 个槽:腕部相机视角,提供手部物体交互细粒度细节。
若数据集相机数量超过 4 台,随机采样子集填充槽位,引入视角数据增强,防止模型过拟合特定相机布局;若相机不足 4 台,空槽零填充。填充空白槽全部编码为全零隐变量张量,自注意力层添加掩码屏蔽,梯度不来自空白填充区域,损失仅在有效观测上计算。该方案让模型无缝读取各类异构机器人多视角数据。
预训练视觉世界模型采用隐空间条件流匹配损失:\(\mathcal{L}_{z}^{pretrain }=\mathbb{E}_{z_{t}, \epsilon, \tau}\left[\left\| v_{\theta}^{z}\left(z_{t}^{\tau} ; z_{<t}, \tau, l\right)-\left(z_{t}-\epsilon\right)\right\| _{2}^{2}\right]\)\(v_{\theta}^{z}\)为参数化速度场,\(z_t^\tau\)为噪声步\(\tau\)插值隐变量,\(z_{<t}\)为自回归历史上下文,l语言条件输入。填充区域损失掩码屏蔽,无梯度反向传播。
世界模型预训练对移动操作至关重要:相比固定机械臂,移动任务存在大量机身位移、视角大范围变化;若世界模型预测质量差,下游动作学习的条件输入不稳定,整体性能大幅下降。大规模预训练让模型微调起点具备更强的具身未来演化表征能力。
4.3 隐动作模型预训练
第二阶段预训练用于构建提取帧级运动监督信号的隐动作编码器。与机器人可执行动作不同,隐动作基于连续帧视觉变化定义,适合大规模视频无监督预训练。
隐动作编码器\(E_m\)训练框架基于 ALAM [62](图 6)。给定时序有序观测三元组\((o_i,o_j,o_k),i<j<k\),隐动作模型学习捕捉观测时序变化的过渡嵌入,并施加代数一致性约束,构建结构化运动表征空间。
设\(m_i^j\)代表从\(o_i\)到\(o_j\)的隐动作,施加两大一致性约束:
-
加法一致性损失:\(\mathcal{L}_{add }=\left\| m_{i}^{k}-\left(m_{i}^{j}+m_{j}^{k}\right)\right\| _{2}^{2} \tag{17}\)鼓励长时序过渡可拆解为多段短时序过渡之和; -
反转一致性损失:\(\mathcal {L}_{rev}=\left\| m_{i}^{j}+m_{j}^{i}\right\| _{2}^{2} \tag{18}\)保证从 A 到 B 的运动表征与 B 到 A 反向运动表征近似抵消。
除关系约束外,模型搭配重建损失、向量量化损失,保证隐编码信息完整、维度紧凑。完整预训练损失:\(\mathcal {L}_{LAM}=\lambda _{vq}\mathcal {L}_{vq}+\lambda _{rec}\mathcal {L}_{rec}+\lambda _{perc}\mathcal {L}_{perc}+\lambda _{add}\mathcal {L}_{add}+\lambda _{rev}\mathcal {L}_{rev} \tag{19}\)
预训练完成后,仅保留隐动作编码器\(E_m\),解码器、向量量化模块全部丢弃。编码器冻结,离线提取机器人轨迹的隐动作监督标签。该阶段两大核心价值:
-
提供细粒度中间表征,弥补未来视频隐变量时序粗糙的缺陷; -
无标注视频运动知识可迁移至机器人动作学习,预训练数据范围远超带动作标注机器人数据集。
4.4 渐进式监督微调
完成世界模型、隐动作编码器预训练后,ABot-M0.5 进入下游机器人数据监督微调阶段,引入显式动作监督,让模型适配任务专属控制分布。本文不直接在最终推演范式下训练,采用渐进式策略:先在干净标注未来条件下稳定世界 - 动作联合学习,再逐步切换至与推理对齐的梦境条件训练。
微调阶段 1(SFT1:世界模型 + 逆动力学联合微调)
初始微调阶段,预训练世界模型与下游数据集存在域偏移;尽管已具备时空先验,但未来预测精度不足以稳定支撑动作学习。若直接基于模型自生成失真画面训练逆动力学,视觉预测噪声会严重干扰动作学习收敛。
因此 SFT1 阶段全部隐动作、可执行动作预测均以真实标注未来视频隐变量为条件,模型联合预测未来视频隐变量、隐动作、可执行动作:\(z_{t+1}\sim p_{z}(\cdot | z_{\leq t},m_{<t},a_{<t},l) \tag{20}\)\(m_{t}\sim p_{m}(\cdot | z_{\leq t+1},m_{<t},a_{<t},l) \tag{21}\)\(a_{t} \sim p_{a}\left(\cdot | z_{\leq t+1}, m_{\leq t}, a_{<t}, l\right) \tag{22}\)
融合式 (5)(9)(13),SFT1 总损失:\(\mathcal{L}_{SFT 1}=\lambda_{z} \mathcal{L}_{z}+\lambda_{m} \mathcal{L}_{m}+\lambda_{a} \mathcal{L}_{a} \tag{23}\)
该阶段为动作学习提供稳定训练环境:未来视觉条件完全干净,逆动力学模型专注学习 “环境未来演化 + 细粒度运动意图→底层控制” 映射,无需补偿预测噪声。本质是在受控条件下,完成世界模型、动作模型交互初始化。
微调阶段 2(SFT2:梦境强制,推理对齐微调)
模型在 SFT1 收敛后,切换至与推理流程完全对齐的微调模式。推理阶段无真实标注未来视频隐变量,仅能依赖模型自生成预测画面。为缩小训练推理分布差距,预测动作时将真实标注未来条件\(z_{t+1}\)、\(m_t\)替换为模型自生成梦境隐变量\(\hat{z}_{t+1}\)、\(\hat{m}_t\):\(a_{t} \sim p_{a}(\cdot | \hat {z}_{t+1},z_{<t},\hat {m}_{t},m_{<t},a_{<t},l) \tag{24}\)
底盘、机械臂分支 CFM 损失更新为基于梦境隐变量的版本,整体 SFT2 损失:\(\begin{aligned} \mathcal{L}_{SFT 2} & =\lambda_{z} \mathcal{L}_{z}+\lambda_{m} \mathcal{L}_{m}+\lambda_{a} \tilde{\mathcal{L}}_{a} \\ & =\lambda_{z} \mathcal{L}_{z}+\lambda_{m} \mathcal{L}_{m}+\lambda_{a}\left(\lambda_{a}^{move } \tilde{\mathcal{L}}_{a}^{move }+\lambda_{a}^{manip } \tilde{\mathcal{L}}_{a}^{manip }\right) \end{aligned}\)
该阶段完整实现 3.4 节梦境强制机制。未来隐动作、可执行动作全部基于模型自生成画面预测,逆动力学模型自主学习容忍视频预测噪声、物体轻微漂移、失真推演场景,大幅提升长时序自回归鲁棒性。
渐进微调设计逻辑
整套微调流程是一套完整对齐渐进过程:SFT1 在下游数据集上对齐世界模型、动作模型,同时隔离早期预测噪声对逆动力学的干扰;SFT2 将动作学习的条件输入切换为部署推理同款输入。模型不再仅优化单步预测精度,而是在自生成失真画面的长时序推演场景下稳定执行。
4.5 高效结构化注意力与隐变量增强
前文整套训练流水线需要对多 Token 流、多模态长序列联合建模,无额外优化时训练计算成本极高。本文引入两项工程优化,在不破坏模型语义的前提下提升训练效率、数据利用率。
高效结构化注意力
ABot-M0.5 采用稀疏结构化自注意力,编码时序因果、模态隔离、Token 流间条件可见关系。朴素实现在完整注意力矩阵上添加显式块掩码,长序列场景计算冗余极大。
本文将结构化注意力拆解为多组稠密子问题,基于变长 FlashAttention 实现。对每个样本、每帧、每类 Token,预计算结构化掩码对应的有效查询 - 键索引区间;将有效区间打包为连续 QKV 片段,在同一变长 FlashAttention 内核中批量执行多组注意力计算。数学等价于原始结构化掩码,但 GPU 计算效率大幅提升。对比 FlexAttention 基线,该方案降低内核开销、消除冗余块填充、减少显存占用;长序列视频 - 动作联合前向 + 反向传播速度提升约 5 倍。
基于偏移的隐变量增强
为避免训练时重复编码原始视频造成计算浪费,模型以固定时序步长H预计算视频隐特征。传统方案视频从首帧切分,\([tH,(t+1)H]\)固定映射至第 t 个隐变量,视频数据利用不充分,时序变化鲁棒性差。
本文引入偏移索引策略:起始偏移量s在区间\(s\in\{0,1,...,H-1\}\)内随机选取。给定偏移s,帧区间\([s+tH,...,s+(t+1)H]\)映射至第 t 个隐变量。H种偏移方式让有效隐变量分段数量扩大H倍,提升时序多样性,实证增强模型对微小时序偏移的鲁棒性。
两大优化在流水线中的作用
上述优化并非孤立工程技巧:高效结构化注意力让多流 ABot-M0.5 长序列联合训练具备可行性;偏移隐变量增强提升数据利用率与时序鲁棒性。二者共同支撑整套渐进式训练流水线,可扩展至超长时序移动操作任务,且不破坏原有架构设计优势。
综上,ABot-M0.5 训练流程整合大规模世界建模、自监督运动抽象、渐进式动作对齐、系统级高效优化四大模块,是将架构创新转化为仿真、实物机器人高性能表现的关键。下一章在多套仿真、真实机器人基准上完整评估整套训练流程与模型性能。
5 实验
本文在多样化移动操作、纯操作、真实机器人基准上开展全面实验,回答四大核心问题:
-
本文框架相比主流 VLA、WAM 基线,是否显著提升长时序移动操作性能? -
架构、训练创新是否同样适用于固定机械臂细粒度操作任务? -
各核心模块分别带来多少性能增益? -
模型能否在真实机器人硬件上稳定部署?
实验基准包含 RoboCasa365、RoboTwin 2.0、LIBERO/LIBERO-Plus,配套完整消融实验、效率分析与实物机器人测试。
5.1 实验设置
评测基准
-
RoboCasa365 [45]:高难度移动操作基准,包含大量家庭复合任务、原子子任务,是长时序移动操作核心评测数据集; -
RoboTwin 2.0 [9]:多任务双臂操作基准,包含干净场景、随机化扰动场景两套评测,评估场景变化泛化能力; -
LIBERO / LIBERO-Plus [16,38]:组合式桌面操作基准,评估多任务、长时序固定机械臂泛化; -
真实机器人任务集:定制实物机器人任务,验证仿真训练模型向真实硬件迁移能力。
所有基准严格遵循官方评测流程、数据划分规则。
对比基线
覆盖主流视觉语言动作(VLA)、世界动作模型(WAM),包含当前最优、近年代表性相关工作;LIBERO-Plus 额外对比混合 VLA + 世界模型、纯 WAM 架构,突出本文模型相比传统世界模型的差异化优势。
评测指标
所有基准遵循官方标准评测指标,核心指标为任务成功率:
-
RoboCasa365:区分已见过原子任务、已见过复合任务、未见过复合任务三类场景单独报告; -
RoboTwin 2.0:干净场景、随机扰动场景下 50 项任务平均成功率; -
LIBERO/LIBERO-Plus:全任务平均标准成功率; -
真实机器人实验:5 项任务,同时统计任务成功率、过程完整度得分。
实现细节
若无特殊说明,ABot-M0.5 均采用第四章完整渐进式训练流水线;视频隐变量主干、隐动作编码器、逆动力学模块联合微调。移动操作任务动作头同时输出底盘、机械臂控制;纯操作基准保留完整架构,仅将动作路由适配对应硬件控制维度。
5.2 移动操作任务核心实验结果
本节基于移动操作核心基准 RoboCasa365 评测,该基准同时要求长时序规划、精准物体操作,覆盖多样化简单子任务、复杂家庭任务链,适配本文框架完整评测。
评测协议
严格遵循 RoboCasa365 标准评测流程,报告整体平均成功率,同时区分已见原子任务、已见复合任务、未见复合任务三类场景性能,分别对应简单局部交互、长时序任务链、全新任务组合三大难度梯度。
主流方法定量对比(表 2、表 3)
ABot-M0.5 整体性能领先,长时序复合任务增益尤为显著,完全匹配架构设计目标:时间粒度对齐保留细粒度交互动力学、动作解耦优化底盘机械臂协同、梦境强制提升长时序推演鲁棒性。
复合任务增益具备关键意义:相比固定机械臂任务,移动复合任务视角变化更大、动作链条更长、推演误差累积更严重;本文模型在该场景下大幅领先基线,证明框架不只是优化底层动作预测,而是从底层结构适配长时序具身控制需求。
定性可视化结果(图 8)
RoboCasa365 典型推演样例可视化:ABot-M0.5 可在导航、操作阶段维持连贯任务流程,物体交互阶段保持高精度细粒度控制。
5.3 纯操作基准实验结果
尽管 ABot-M0.5 专为移动操作设计,但其核心创新具备通用性,细粒度隐动作抽象、推理对齐逆动力学训练同样可提升纯固定机械臂操作性能。本文在 RoboTwin 2.0、LIBERO/LIBERO-Plus 开展评测。
RoboTwin 2.0 双臂操作基准
包含标准干净场景、背景 / 布局 / 光照 / 桌面随机扰动困难场景两套评测,报告平均任务成功率(表 4)。ABot-M0.5 在两套场景下均取得领先效果,证明模型优势不局限于 RoboCasa365 移动场景,可泛化至高维多任务纯操作;隐动作抽象提升无底盘场景下细粒度控制精度,梦境强制训练提升视觉扰动下鲁棒性。
LIBERO / LIBERO-Plus 桌面组合操作基准
LIBERO、LIBERO-Plus 聚焦组合式桌面操作、长时序多任务泛化,验证模型在牺牲移动模块后是否仍保留高精度操作能力。ABot-M0.5 取得领先、具备竞争力的评测结果,证明拓展至移动操作时,架构未牺牲纯机械臂操作精度。
跨场景泛化结论
实验结果证明 ABot-M0.5 增益不局限单一基准、移动专属场景;性能提升来源于对环境未来演化、局部运动抽象、逆动力学建模的通用优化。
5.4 消融实验
本节消融实验定量验证三大对齐核心设计的独立增益,分别验证时间对齐(隐动作)、动作空间对齐(双层 MoT)、推演对齐(梦境强制)三大模块的作用。
消融 1:中间隐动作模块有效性
对比无隐动作、视频直接映射动作、两阶段拼接、三级分层独立流四种架构(表 7、图 9)。移除隐动作模块后,所有需要精准接触交互的任务性能显著下降,证明粗粒度视频隐变量无法支撑细粒度控制。最优方案为本文三级分层独立流架构,视频、隐动作、动作 Token 分配独立时序、模态标识,结构化掩码严格控制因果注意力流向:视频 Token 无法读取隐动作 Token,消除表征泄露;动作 Token 可完整读取隐动作表征,保证底层控制依托细粒度运动意图,最终在 RoboTwin 2.0 干净场景达到 94.0% 成功率。
同时验证训练时隐动作丢弃概率\(p_{drop}\)的影响:\(p_{drop}=0\)时训练推理注意力对齐完全,性能最优;\(p_{drop}=0.2\)引入条件丢弃,推理阶段隐动作始终可用,造成训练推理不匹配,性能下降。
消融 2:动作解耦双层 MoT 有效性
选取 RoboCasa365 已见复合长时序任务(频繁切换底盘导航、机械臂操作)开展消融,对比仅模态分层 MoT、双层动作解耦 MoT 两套架构。单层模态 MoT 基线成功率 0.34,本文动作解耦 MoT 达到 0.48;训练收敛曲线(图 10)显示解耦架构收敛速度更快,证明动作子空间解耦可消除底盘、机械臂梯度相互干扰。
消融 3:梦境强制(DF)训练有效性
基于 RoboCasa365 目标已见原子任务消融(表 8),统一从 50k 教师强制训练 checkpoint 继续训练:
-
仅继续教师强制训练 5k 步:成功率从 67.55% 下降至 66.78%;继续训练 10k 步仅恢复至 68.90%; -
切换梦境强制 SFT2 训练仅 5k 步:成功率提升至 70.56%,绝对值提升 3.01%,计算量仅为基线一半。结果证明梦境强制有效弥合训练推理鸿沟,大幅提升动作预测鲁棒性。
消融 4:预训练 + 微调完整流水线有效性
在 RoboCasa365 目标 10% 小数据场景消融:完整预训练 + 微调方案成功率 49.0%;直接基于 Wan2.2 主干微调仅 17.8%,差距 31.2%。仅靠微调无法从小规模演示数据中学习充足视觉动力学、操作行为;大规模预训练提供可迁移视觉、交互先验,大幅提升下游样本效率。
文本 - 视频注意力可视化(图 11)验证该结论:原始 Wan 模型注意力分散,易被背景干扰;预训练后注意力集中于机械臂、交互区域;预训练 + 微调组合实现最精准目标聚焦,完全忽略无关背景杂物。
消融实验总结
各模块互补、缺一不可:
-
大规模预训练:模型注意力聚焦交互前景物体,建立基础视觉交互先验; -
隐动作分层建模:打通视频粗粒度表征与底层精细控制的时序鸿沟,提升操作精度; -
双层解耦 MoT:分离底盘、机械臂动作空间,大幅提升移动操作长时序任务性能; -
梦境强制微调 SFT2:对齐训练、推理输入条件,提升长时序推演鲁棒性,降低误差累积。整套框架是协同设计的完整系统,而非零散技巧堆叠。
5.5 真实机器人实物实验
本节在实体机器人平台评测,验证仿真训练模型向真实硬件迁移泛化能力,同时评估两大核心能力:高精度细粒度操作、长时序多步骤闭环控制。
实验硬件与设置
实验平台:Agilex Piper 单 6 自由度机械臂;每项实物任务仅采集 50 条真实演示数据,评估小样本部署效率。对比基线:\(\pi_{0.5}\)[53]、Fast-WAM [76]。两类评测任务:
-
细粒度精准操作:插销圆柱任务,要求精准定位、稳定闭环控制,对视觉 - 动作对齐误差极度敏感; -
长时序复合任务:摆盘、水果整理、插花、叠杯,需要持续理解语言指令、动态更新场景状态、多轮物体交互完成目标。
实物实验定量结果(图 12)
ABot-M0.5 在全部实物任务上性能全面领先基线:
-
插销圆柱精细操作:成功率 70%,过程完整度 96%;\(\pi_{0.5}\)仅 50%/90%,Fast-WAM 仅 30%/77%。隐动作表征弥补粗粒度视频表征捕捉精细运动动力学的缺陷,大幅提升操作定位精度。 -
长时序复合任务:摆盘 70%、整理水果 80%、插花 60%、叠杯 80%;Fast-WAM 全部任务成功率仅 20%~40%;所有任务过程完整度均高于 88%。实验证明世界建模架构可有效建模长时序时空依赖,支撑稳定连续决策,抑制基线模型常见的误差累积崩溃问题。
同一套模型无需任务专属修改,即可同时适配精细操作、长时序移动复合任务;双层 MoT 架构分离多模态、多动作分布的优势充分体现。全程高过程得分证明梦境强制成功缩小训练推理鸿沟,部署后机器人执行稳定性显著提升。
整体实物实验结论:ABot-M0.5 可稳定迁移至真实机器人硬件,表现持续可靠。
6 结论与未来工作
本文提出统一世界动作模型 ABot-M0.5,通过协同优化时间对齐、动作抽象构建鲁棒移动操作智能体。针对现有世界动作模型三大结构性不匹配,提出三项核心创新:
-
引入中间隐动作,打通视频表征与底层控制的粒度鸿沟; -
设计双层混合 Transformer 架构,解耦异构动作子空间; -
提出梦境强制训练策略,基于模型自生成预测画面训练逆动力学,弥合动作预测的训练推理鸿沟。
在 RoboCasa365、RoboTwin 2.0、LIBERO/LIBERO-Plus 仿真基准、真实机器人实物任务上开展大量实验,ABot-M0.5 在长时序移动操作、细粒度固定机械臂操作任务上全面超越主流 VLA、WAM 基线,取得当前最优性能。实验证明:世界模型拓展至移动操作的核心路径并非单纯扩大模型规模,而是系统化统一未来视觉预测、动作解耦、部署鲁棒性三大模块。
未来工作规划
-
数据与硬件泛化:扩充大规模真实世界数据、覆盖更多异构机器人硬件,走出实验室受控场景,验证复杂无结构化真实环境泛化能力; -
世界模型缩放定律:系统性研究世界动作模型性能随模型容量、数据规模、计算预算的缩放规律,为后续架构设计提供理论指导; -
长时序高效记忆机制:设计轻量化压缩记忆模块,支持超长时序上下文存储检索,避免灾难性遗忘,适配开放式无限长任务; -
推理加速优化:高级解码策略、硬件感知推理加速,保证边缘设备实时机器人控制。
以上工作将持续推进具身智能边界,推动世界动作模型从仿真、实验室原型走向通用可部署物理智能体。
7 作者贡献
数据采集与标准化
杨雁丹、陈荣瀚、陈宇之、刘浩云、戚德康
模型架构与训练流程
陈荣瀚、唐佐金、林桐、杨雁丹
后训练与评测实验
唐佐金、李天伦、吴浩宁、陈荣瀚、林桐、王铭鑫、胡斌
真实机器人部署实验
霍东杰、郑露露、袁博泰
论文撰写
杨雁丹、陈荣瀚、唐佐金、戚德康、刘浩云
挑战赛参赛相关工作
朱彦清、梅伟、轩宇泽、杨浩龙、霍东杰
项目负责人
常新远
通讯指导导师
徐牧(xumu.xm@alibaba-inc.com)、马志恒
参考文献(略)

