AI PAPER · 深度解读 2026.07
机器人只看2D视频就够了?
让机器人学会 “预判”4D世界
的端到端世界模型
RynnWorld-4D · 达摩院 · RGB-DF联合生成 · 策略SOTA
RynnWorld-4D · 阿里达摩院 & CUHK
📦 4 PARTS + CONCLUSION
👉 滑动
PART 01
2D的困境
几何缺失是硬伤
PART 02
RGB-DF方案
三分支联合生成
PART 03
训练与数据
2.5亿帧+三阶段
PART 04
策略SOTA
看懂→做对
PART ///
写在最后
4D世界模型的意义
当机器人不再只“看”视频,而是预判三维世界如何运动——具身智能的真正拐点就到了。
2025年以来,“世界模型”成了AI圈最热的词之一。从Sora到各类视频生成模型,AI似乎已经能够“理解”物理世界—— 但真的是这样吗?
对于需要精确操控的机器人来说,仅仅生成好看的视频远远不够。它需要知道物体在三维空间中“在哪里”、“怎么动”、“下一步该去哪”。换句话说, 机器人需要的不是2D视频,而是4D世界模型 ——同时理解空间几何与时间演化的能力。
阿里巴巴达摩院联合香港具身AI实验室、CUHK和湖畔实验室,在最新论文中提出了 RynnWorld-4D ——首个端到端4D具身世界模型。它不仅能“看”场景,还能“预判”场景的3D结构如何在交互中运动,并将这种理解直接转化为机器人动作。
01
PART
为什么2D视频不够?
THE LIMIT OF 2D WORLD MODELS
过去两年,视频世界模型取得了惊人进展。Sora、Genie、GameGen等模型能够生成逼真的视频片段,让人惊叹AI的“想象力”。然而,这些模型的共同致命缺陷是—— 它们只在2D像素空间工作 。
对机器人操控而言,这意味着什么?想象一下:你让机器人去抓桌上的杯子。它看到了一个2D图像,知道“那里有个杯子”,但它不知道杯子离它多远( 深度信息缺失 )、杯子朝哪个方向( 6自由度位姿缺失 )、以及它伸手过去杯子会不会被碰倒( 3D运动预测缺失 )。
更深层的问题在于,2D像素模型缺乏 几何基础 。论文中指出,纯2D模型会产生严重的时间不一致性:物体尺度在不同帧之间波动、出现非物理形变(物体凭空拉伸或压缩)、场景结构在时间维度上不连贯。这些在视频中可能只是“看着有点怪”,但对机器人来说就是灾难——它无法基于这些不一致的预测做出精确动作。
2D像素世界模型像看皮影戏——看到影子的变化,却永远不知道背后的物体到底是什么形状、在怎么动。
已有的尝试通常是“分步走”:先用视频模型生成2D画面,再单独跑一个深度估计模型或光流模型来补充3D信息。这种做法不仅 推理效率低下 ,更关键的问题是各模块之间缺乏一致性——深度图和视频帧可能对不上,光流和几何结构可能矛盾。机器人拿着这些相互矛盾的信息,根本没法做出好决策。
现有的一些3D世界模型(如Genie 2、UniSim)虽然能输出3D信息,但它们通常依赖昂贵的多步去噪或显式3D表示(如NeRF/3DGS),推理速度慢、难以实时部署。RynnWorld-4D选择了一条不同的路。
既然外观、几何、运动三者缺一不可——何不一次全部生成?
02
PART
RGB-DF:外观+几何+运动一次生成
RGB-DF JOINT GENERATION
RynnWorld-4D的核心创新在于提出了一个 投影4D表示 :不再只生成RGB视频,而是同步生成三种模态—— RGB视频 (外观纹理)、 深度图 (每个像素到相机的距离)和 光流 (像素在帧间的运动方向与幅度)。三者合称 RGB-DF 。
深度图将每个2D像素“提升”到3D空间位置——有了深度,一张平面图就变成了有前后关系的立体场景。而光流描述了像素如何在帧间移动,结合深度信息,光流可以被反投影为 3D场景流 ——即场景中每个点在三维空间中的真实运动向量。RGB告诉你“是什么”,深度告诉你“在哪里”,光流告诉你“怎么动”。
更妙的是,这三种表示都存在于 统一的2D图像平面 上,不需要昂贵的3D体素表示或NeRF重建。这意味着模型可以像生成视频一样高效地生成完整的4D理解——而计算成本大幅降低。
三分支Transformer架构
为了同时处理三种模态,研究团队基于预训练视频扩散模型 Wan 扩展出一个三分支Transformer结构。每个分支专门处理一种模态:RGB分支捕捉外观纹理,深度分支编码几何结构,光流分支建模运动模式。
关键设计是 联合跨模态注意力模块(JA) 。它在三个分支之间建立注意力连接,强制跨模态一致性——确保RGB中看到物体边缘的地方,深度图也有对应的几何跳变,光流也反映该物体的运动边界。三种模态不再是独立的三个输出,而是一个物理一致的4D场景的不同投影面。
另一个关键组件是 3D RoPE (三维旋转位置编码)。传统的旋转位置编码只处理时间和2D空间,RynnWorld-4D将其扩展到三个分支共享的3D空间,确保不同模态在同一空间位置上的编码一致——这让模型“知道”RGB、深度、光流三个分支说的是同一个位置的同一件事。
💡 KEY INSIGHT: RGB-DF表示的核心优势在于——相比2D像素的逐帧变化, 深度+光流直接对应机器人的动作空间 。机器人控制的本质就是在3D空间中规划和执行运动——而RGB-DF恰好就是这种运动的显式表达。
03
PART
三阶段训练+2.5亿帧数据
TRAINING & DATASET
训一个同时输出三种模态的模型,最大的挑战不是架构设计,而是 数据和训练策略 。论文在这两方面都给出了系统性的解决方案。
Rynn4DDataset 1.0:2.544亿帧的具身数据
团队构建了目前已知最大规模的具身世界模型数据集—— Rynn4DDataset 1.0 ,总计超过 2.544亿帧 视频,配有高质量的深度和光流伪标注。
数据来源有两个核心部分: 第一人称人类活动数据 (如Epic-Kitchens、Ego4D等),捕捉人手与物体交互的丰富模式;以及 机器人操控数据 (如Open X-Embodiment等),直接提供机器人视角的操控经验。两类数据的融合使模型既具备广泛的物理直觉,又有精准的操控知识。
三阶段渐进式训练
训练策略采用 三阶段渐进式方案 ,避免了一步到位训练多模态模型的不稳定性:
模态适应
冻结RGB权重,深度/光流分支先各自学习基础语法
联合注意力
开启JA模块,三个分支开始“交流”跨模态对应
全参数微调
解冻所有参数,端到端联合优化
三阶段渐进式训练:先各自学 → 再一起学 → 最后端到端精调
这种渐进式策略的核心思想是“先各自学、再一起学”——避免了多模态联合训练初期因各分支能力差异过大导致的优化不稳定问题,与课程学习(curriculum learning)的理念一脉相承。
世界模型如果只是“看得懂”,那只是半篇文章;能做“做得到”,才是闭环。
04
PART
策略SOTA:从“看懂”到“做对”
FROM UNDERSTANDING TO ACTION
世界模型的最终价值在于服务于策略学习——让机器人基于对世界的理解做出正确动作。RynnWorld-4D在这方面交出了令人印象深刻的答卷。
4D世界建模:精度全面领先
在4D世界建模基准上,RynnWorld-4D的几何精度指标 δ₁达到0.610 ,是此前最好的4DNeX(0.327)和TesserAct(0.279)的近 2倍 。光流方面,AEPE=0.170,RynnWorld-4D是目前唯一能同步输出显式运动场的4D世界模型——其他模型要么不支持深度输出,要么不支持光流输出。
δ₁ = 0.610
几何精度 · 2× SOTA
9Hz
闭环控制频率
唯一
同步输出运动场
RynnWorld-4D-Policy:单次前向传播出动作
论文提出的 RynnWorld-4D-Policy 是这套系统的“最后一公里”。它的核心设计非常巧妙:不在推理时反复执行耗时的去噪步骤,而是添加一个 逆向动力学头 ,直接从4D世界模型的特征中提取机器人动作。
这意味着什么?传统方法需要在推理时执行多步去噪才能获得预测结果,每步都需要完整的网络前向传播,计算量巨大。而RynnWorld-4D-Policy 只需单次前向传播 即可提取特征并输出动作,将推理速度提升了一个量级——在RTX 5090上实现了约 9Hz闭环控制频率 ,配合动作分块(K=10)和50Hz顺序执行,完全可以满足灵巧操控的实时性要求。
单次前向传播提取4D特征 → 逆向动力学头输出动作——绕过昂贵的多步去噪,这是世界模型走向实时控制的关键一步。
真实操控任务:大幅领先现有方法
在真实机器人操控实验中,RynnWorld-4D-Policy展现了强大的泛化能力。在 Lid Placement任务 中达到65.71%的成功率,大幅超过Diffusion Policy的8.57%——提升了近 8倍 。在Handover(递接物体)任务中,RynnWorld-4D-Policy也远超基础模型π₀和π₀.₅。
| 实验指标 | RynnWorld-4D | 对比基准 |
|---|---|---|
| Lid Placement | 65.71% | Diffusion Policy 8.57% |
| 几何精度 δ₁ | 0.610 | 4DNeX 0.327 |
| 推理延迟 | ~1.1s(单次前向) | 多步去噪 >>5s |
| 控制频率 | 9Hz | 满足实时操控 |
这些结果表明, 4D几何理解带来的不仅是“看得更准” ,更是“做得更对”。当机器人真正理解了场景的三维结构和运动趋势,它的动作规划就不再是盲目的试错,而是基于物理直觉的精准预判。
///
LAST
写在最后
THE SIGNIFICANCE OF 4D WORLD MODELS
RynnWorld-4D的意义不仅在于一个模型架构的创新,而在于它 重新定义了“世界模型”对机器人的含义 。过去,世界模型是“生成好看的视频”;在RynnWorld-4D之后,世界模型变成了“理解三维世界如何运动,并据此指导行动”。
从技术路线看,这篇论文给出了一个重要的启示:与其在2D像素上不断堆叠更大的模型,不如 回到物理世界的本质表示 。深度、光流、3D场景流——这些计算机视觉的经典概念,在扩散模型的框架下重新焕发了生命力。它们不仅让模型“理解”得更好,更让下游的机器人控制“做得”更准。
当然,这项工作也有其局限。论文坦言当前推理延迟约1.1秒,距离高频实时控制仍有差距;数据集虽大但深度/光流标注为“伪标注”,质量上限受限于生成方法。但这些恰恰指明了下一步的研究方向。
当机器人真正拥有了4D世界模型,它就不再只是执行指令的机械臂,而是能预判、能规划、能理解物理世界的智能体。
RynnWorld-4D已全面开源(代码、模型、数据集),这为整个具身智能社区提供了一个强大的基础设施。可以预见,4D世界模型将成为下一代机器人操作系统的核心组件——而RynnWorld-4D,正在为这个未来奠基。
📎 论文资源:
项目主页 alibaba-damo-academy.github.io/RynnWorld-4D.github.io |
代码 github.com/alibaba-damo-academy/RynnWorld-4D |
模型已上线 HuggingFace + ModelScope
既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。
THANKS FOR READING

