大数跨境

刚刚,李飞飞掀桌!全球首个多模态世界模型发布,几张照片省掉几百个机位

刚刚,李飞飞掀桌!全球首个多模态世界模型发布,几张照片省掉几百个机位 APPSO
2026-09-02
3
导读:大模型理解文字,李飞飞想让 Atlas 理解空间
前脚友商还在为生成几秒钟的视频激烈竞争,后脚李飞飞创办的 World Labs 便推出了颠覆性产品——全球首个多模态世界模型 Atlas 正式登场。
按照官方定义,Atlas 是一款面向空间智能的全能世界模型(omni world model)。它从零开始预训练,可原生处理文本、图像、视频、相机位姿与 3D 深度信息,并在同一套模型中完成世界生成、空间重建和时空模拟。

相机控制生成:从“玄学”到精确操控

传统视频生成模型往往依赖提示词“抽奖”,难以精准控制运镜。Atlas 则将「相机位姿参数」作为底层原生输入。用户只需提供坐标轨迹,丢入 1 到 6 张普通照片,即可生成长达 1 分钟、分辨率达 1440p 的大片,且画面空间几何一致性极高。
更令人惊叹的是其空间推理能力。输入单张机器人正面照,Atlas 能补全背影;输入泳池边角照,它能基于世界常识修复未拍摄到的草坪和远山。
当然,当镜头进入原图未覆盖区域时,模型仍需依赖先验知识进行推测。视角跨度越大,局部几何漂移或纹理闪烁的风险也随之增加。因此,它生成的更像是一个视觉合理的三维世界,而非原世界的精确数字复刻。

核心机制:空间上下文与多视角合成

Atlas 的核心在于引入「空间上下文」(Spatial Context)概念。不同于大语言模型的文本接龙,Atlas 为每张图片绑定三维坐标和深度,构建带轴网的立体空间。其底层逻辑离不开多视角合成:将不同角度的素材整合至同一三维空间,判断相对位置并补全缺失区域,最终拼凑成连续、可漫游的三维场景。即便输入两张无关照片,Atlas 也能强行脑补出走廊或房间将其无缝连接。

空间重建:低成本构建高精度 3D 世界

传统的 3D 高斯泼溅或点云扫描需要大量专业设备和照片,而 Atlas 仅需 2 到 25 张游客视角的地面平拍照片,即可还原复杂场景细节。在斯坦福大学 Main Quad 案例中,模型成功还原了草坪、拱廊及教堂外墙,并支持上帝视角的航拍漫游。
在 DTU、ETH3D、ScanNet 等公开数据集的稀疏视角重建误差测试中,Atlas 得分 25.3(分数越低越好),显著优于 Pi3X(28.7)、Depth Anything 3(39.3)及 MapAnything(47.7)。
输出结果可直接对接点云和 3D Gaussian Splatting,无缝接入 World Labs 自家的 Marble 平台进行高帧率即时渲染。此外,Atlas 还支持类似“子弹时间”的视频重构图功能,仅需几台普通相机拍摄的日常视频,即可在虚拟空间中自由切换视角,复刻电影级特效。

终极目标:赋能具身智能与机器人

李飞飞团队研发 Atlas 的终极目标并非争夺影视特效市场,而是解决具身智能领域的核心痛点:虚拟训练场匮乏。传统机器人训练要么实地试错成本高昂,要么依赖人工搭建仿真环境。据估算,完全依靠传统方式收集足够规模的训练数据,成本可能高达 100 万亿美元。
Atlas 提供的 Real to Sim 路线省去了繁琐的人工建模过程。只需录制一段真实场景视频,模型即可生成高精度 3D 物理空间,供机器人在孪生世界中疯狂试错。无论是刚性碰撞还是软体形变,Atlas 均能模拟受力反馈,并实时渲染机载摄像头应见的 RGB 图和深度图,极大降低了数据采集与场景搭建的成本。

技术架构:多模态自回归扩散 Transformer

World Labs 采用了硬核的技术组合:多模态自回归扩散 Transformer。该架构融合了当前两大主流范式的优势:
多模态融合:原生融通文本、二维图像、相机位姿与 3D 深度;
自回归机制:像语言模型预测下一个词一样,在时空序列中逐级预测新的空间状态;
扩散机制:基于 Rectified Flow 逐步去噪,确保连续高维信号的画质与几何精度;
Transformer 底座:利用成熟的矩阵乘法结构,无缝适配现有大规模算力集群。
这套架构使 Atlas 兼具 LLM 的推理优化能力与扩散模型的采样优势。在镜头运动控制的真人盲测中,Atlas 表现卓越:对阵 MiniMax H3 胜率 75%,Gemini Omni Flash 胜率 81%,FLUX 3 胜率 93%,面对 Seedance 2.5 胜率更是高达 94%。
除核心功能外,Atlas 还具备优秀的图像生成能力,支持复杂提示词、文字渲染及多种艺术风格。更有特色的是,它能直接根据文字或图片生成 360°全景图,有效处理空间连续性问题。

Scaling 效应与未来展望

官方博客指出,随着参数量和算力的增加,Atlas 展现出了类似大语言模型的“涌现”能力,验证了暴力 Scaling 依然是提升性能的关键路径。目前,Atlas 已向部分合作伙伴开放早期访问,并将作为底层模型驱动 World Labs 的其他产品。
回顾李飞飞的学术生涯,从 ImageNet 让机器识别像素,到如今通过 World Labs 探索三维空间理解,她始终致力于解决同一个核心问题:机器是否真正理解了背后的三维空间及下一秒的变化?
李飞飞曾形容当下的大语言模型为“黑暗里的文字高手”,虽能谈论现实却缺乏生活经验。Atlas 所代表的空间智能,正是为语言智能补全了关于几何、物理、时间和行动的世界经验。如果说 LLM 赋予了机器互联网知识,那么世界模型将颁发给机器从数字世界走向现实世界的入场券。
【声明】内容源于网络
0
0
APPSO
AI第一新媒体,「超级个体」的灵感指南。 #AIGC #智能设备 #独特应用 #Generative Al
内容 15704
粉丝 0
APPSO AI第一新媒体,「超级个体」的灵感指南。 #AIGC #智能设备 #独特应用 #Generative Al
总阅读402.4k
粉丝0
内容15.7k