大数跨境

李飞飞,发了个能“暂停时间”的世界模型

李飞飞,发了个能“暂停时间”的世界模型 智东西
2026-09-02
3
导读:一张地面照生成鸟瞰图,2张图重建三维空间。

一张地面照生成鸟瞰图,2 张图重建三维空间。
编译 |  王涵
编辑 |  心缘
智东西 9 月 2 日消息,今日凌晨,"AI 教母”李飞飞创立的世界模型公司 World Labs 正式发布新一代世界模型 Atlas。
Atlas 采用多模态自回归扩散 Transformer 架构,将所有输入融合至共享的空间上下文中。基于此上下文,模型不仅能预测后续内容、保持三维空间连贯性,还能推演视野之外的景象。此外,Atlas 遵循 Scaling Law,性能随训练计算量增加而稳步提升。
该模型具备世界生成、重建和模拟三大核心能力:
1、摄像机控制生成:支持像素级精准控制,可依据单张或多张图像生成长达一分钟、分辨率高达 1440p 的视频。
2、空间重建:仅需一至数十张图像即可重建真实三维场景,既能生成新视角图像,也能输出显式 3D 数据,表现超越专用重建模型。
3、时空模拟:基于输入视频联合建模时空,支持视频重构图,并为机器人领域开启“真实到模拟”的工作流程。
4、图像生成:可根据文本描述生成图像及 360°全景图,精准遵循复杂指令并呈现多样视觉风格。
World Labs 团队表示,Atlas 将作为核心技术驱动旗下 Marble 及未来产品的迭代升级。

可想象摄像机后方场景,支持 360°全景图生成

在摄像机控制方面,Atlas 能根据参考图像在用户指定的任意位置和角度生成全新视角。生成的画面与输入内容的几何结构严格匹配,并可平滑向外推演,补全未呈现的场景部分。
Atlas 能够驾驭多种场景类型、视觉风格及摄像机运动轨迹,并将摄像机几何参数作为原生输入,使用户能精准掌控每一帧的构图与运动细节。
即便仅凭一张输入图像,Atlas 也能结合自身世界知识,想象并生成场景在新视角下的样貌。
与大语言模型类似,Atlas 先将输入编码为上下文,但其独特之处在于将每张图像锚定在三维空间的特定位置,构成空间上下文。用户可将两张无关图像指定不同空间位置,Atlas 即可生成二者间平滑过渡的世界。
通过将摄像机运动控制与空间上下文管理相结合,Atlas 可生成长视频。用户仅需少量参考图像,手动设计穿越场景的摄像机路径,即可生成分辨率为 1440p、时长一分钟的连贯视频。
除世界建模外,Atlas 还支持根据文本提示生成图像,涵盖复杂指令、文字渲染及多种视觉风格。同时,它也能基于文本或图像输入生成覆盖多场景类型的 360°全景图。

两张图片即可重建三维空间,支持地面照生成鸟瞰图

在空间重建领域,Atlas 在“基于稀疏输入图像的新视角合成”这一长期难题上取得初步突破。用户可自由选择输入图像数量,若某些区域不可见,模型会利用世界知识合理补全;也可关闭“想象”模式进行精确重建,其空间上下文最多可容纳上百张图像以实现高保真复现。
例如,Atlas 仅凭一张地面照片即可生成场景鸟瞰图,精准还原可见部分并想象缺失区域。随着输入图像增加,生成的场景完整性显著提升。
在斯坦福大学主方庭的重建案例中,Atlas 仅接收 25 张地面拍摄图像,便直接生成了从校园上空远距离俯瞰的飞行路径画面。
面对同一场景,Atlas 能生成多条不同的运动轨迹,且无论摄像机路径如何调整,场景始终保持连贯。用户还可自由调整画面的速度、长度或复杂度。
针对机器人、游戏及特效等领域对显式三维输出的需求,Atlas 原生支持二维图像帧与三维深度图的双重处理,可将生成的世界以点云或 3D 高斯泼溅形式输出。
从单张图像出发,Atlas 可估算三维几何并转换为 3D 高斯泼溅;若输入为真实空间视频,模型则预测每帧深度并整合为三维重建,最终填补空缺并在设备端进行高分辨率、高帧率渲染。

三机位模拟“子弹时间”,赋能机器人导航仿真

作为世界模拟器,Atlas 兼具空间结构与时间演变的理解能力,可广泛应用于视觉特效与机器人领域。
在影视特效方面,仅需三台普通摄像机同步录制的画面,Atlas 即可构建“子弹时间”多视角拍摄系统,实现时间定格与镜头角度的任意调整。
在机器人仿真领域,Atlas 为导航与操作任务的“真实到模拟”规模化扩展提供了新方案。当模拟机器人在空间中移动时,模型会同步生成其传感器沿途应观测到的 RGB 图像与深度数据。
测试显示,仅用手机拍摄的两个大型环境各 24 帧画面,Atlas 即可重建场景并模拟不同类型机器人沿不同路径行进的实时视角画面。
在操作类任务中,仅需几段随意录制的视频,Atlas 就能构建捕捉物体运动与交互的仿真环境。任务完成后,用户可替换物体、调整位置、改变动作或光照背景等变量,为机器人规模化训练提供多样化数据与测试环境。

融合 LLM 与扩散模型优势,指令遵循度与重建精度领先

Atlas 采用全新统一架构,以空间控制为核心,融合多模态处理、自回归生成、扩散模型与 Transformer 骨干网络。该架构原生支持文本、图像、相机位姿及 3D 深度图,视频以图像序列形式输入。
模型通过逐一生成序列元素实现输出,并采用逐步去噪方式生成高质量图像与视频。Transformer 结构确保了与现代硬件的适配性。
这一设计融合了大语言模型与视频模型的双重优势:既可采用 KV cache、分离式服务等大模型加速技术,也能应用扩散蒸馏、无分类器引导等前沿算法。
在摄像机控制对比中,Atlas 原生支持相机参数编码,相比其他需依赖文本描述(如平移、推轨)的模型,其对摄像机指令的遵循度更高,尤其在复杂轨迹下优势明显。
此外,在稀疏输入三维重建任务中,Atlas 的表现优于最佳的专用开源重建模型。

结语:统一架构兼顾多任务,给出世界模型工程化答案

Atlas 的发布标志着 World Labs 在空间智能领域迈出实质性一步。与过往侧重单一模态或特定任务的模型不同,Atlas 从设计之初便以空间为核心,将多模态理解、三维重建、时空模拟与生成能力融于一体,构建了可扩展的世界模型底座。
从技术路径来看,这种统一架构不仅降低了多任务部署的复杂度,也为后续与机器人、VFX、游戏等行业的深度结合预留了接口。
【声明】内容源于网络
0
0
智东西
各类跨境出海行业相关资讯
内容 11802
粉丝 0
智东西 各类跨境出海行业相关资讯
总阅读221.3k
粉丝0
内容11.8k