按照官方定义,Atlas是一款面向空间智能的omni world model,从零开始完成预训练,可以原生处理文本、图像、视频、相机位姿与3D深度信息,并在同一套模型中完成世界生成、空间重建和时空模拟。
一张图,脑补整个世界
以前玩视频生成模型,多少有点玄学抽奖。在Prompt框里卑微敲下“镜头缓慢向左拉升、绕着人物微仰角旋转”,回车之后全凭老天保佑。
Atlas的做法则是:直接把“相机位姿参数”当作底层原生输入。你要什么角度、什么轨迹、走多快?直接给坐标!
只要丢进去1到6张普通照片,定好运镜轨迹,Atlas就能生成最长达1分钟、1440p分辨率的大片。画面不崩,空间几何丝滑一致,堪称外挂级运镜。
几张照片,省掉几百个机位
传统3D高斯泼溅或者点云扫描,得扛着专业设备围着目标转几十圈,拍几百上千张照片,费钱又费腿。
Atlas再次露出神秘的微笑:一边去,哪来这么多规矩。
官方直接甩出斯坦福大学Main Quad的案例——只需2到25张游客视角的地面平拍照片,就能轻松还原草坪、拱廊和纪念教堂的全部细节,镜头随后拔地而起,来了一段上帝视角航拍漫游。
官方数据显示,在DTU、ETH3D、ScanNet等多个稀疏视角重建基准上,Atlas的平均误差比当时领先的专用三维重建模型还低约12%。
能“暂停时间”的世界模型
Atlas的第三张王牌是时空模拟。它可以根据输入视频同时建模空间和时间,转换已有视频的观察视角,制作具有戏剧性的视觉效果。
测试结果显示,Atlas对摄像机指令的遵循度更高,在复杂轨迹下优势更明显。
技术底牌:多模态自回归扩散Transformer
Atlas是一个全能模型(omni model),目标是在统一架构中同时处理多任务、多种输入输出。团队为其设计了全新的基础架构——多模态自回归扩散Transformer。
文本、图像、视频、3D数据……各种输入都会被锚定在三维空间中,形成空间上下文。就像大模型看上文接下文,Atlas给每张图片绑死三维坐标和深度,在脑子里搭出一个带轴网的房间。
机器人训练的“虚拟道场”
对于具身智能和机器人领域,Atlas的价值同样炸裂。仅需喂几张照片,它就能生成逼真的RGB和深度数据,让机器人在更多不同的模拟空间中进行训练和测试。
目前部分合作伙伴已获得Atlas抢先体验资格,未来几周将开放早期访问。World Labs官方表示,Atlas将成为未来版Marble以及其他产品的底层模型。
大模型理解了文字,而Atlas——开始理解世界本身。

