只要你在物理世界移动,“新视角预测”就是下一个 Token。
出品丨奇点折射(ID:rgznai100)
a16z 合伙人 Martin Casado 与 World Labs 三位联合创始人——李飞飞、计算机视觉学者 Justin Johnson,以及 NeRF(神经辐射场)开创者 Ben Mildenhall 展开深度对谈。近期,李飞飞创立的 World Labs 发布了新模型 Atlas,引发业界高度关注。

现有视频模型普遍存在痛点:画面虽逼真,但本质是“靠提示词抽卡”,镜头稍作移动,空间与物体关系便错乱;而传统 3D 扫描虽真实,却需拍摄数百张照片,耗时费力。
Atlas 旨在解决这一难题,将“内容生成”与“三维重建”融合于同一架构。其核心原语为“新视角预测”(New View Prediction):无论输入几张日常照片,只要指定相机坐标,模型即可推演出该物理位置下的世界景象。

在应用落地层面,对话聚焦于机器人与具身智能。李飞飞指出,制约机器人落地的关键并非算力或芯片,而是物理世界的数据荒漠。采集真实数据成本高、周期长,而 Atlas 展现出的极速“现实到仿真”(Real-to-Sim)能力,正是解决数据饥渴的最优路径。
此外,团队从进化论视角解读空间智能:大语言模型依靠“预测下一个 Token"实现智能涌现,而三维世界模型的原语则是“新视角预测”。正如李飞飞所言,大自然赋予动物眼睛而非树木,是因为移动必然带来新视角的预测需求。
核心要点速览
- 告别“老虎机式”生成:Atlas 中每一帧均绑定严谨的三维相机位姿,画面布局、朝向与轨迹精准受控,彻底区别于传统视频模型的随机生成。
- 从百张到三张:稠密 3D 重建通常需拍摄上百张照片,Atlas 将视角需求削减数十倍,仅凭少量照片甚至老旧影像即可补齐死角,完成严丝合缝的空间生成。
- 填补物理数据荒漠:当前机器人领域的最大瓶颈是物理交互数据的极度稀缺,Atlas 提供了高效的数据生成方案。
- 动态中提纯空间:高精度静态 3D 几何的构建,反而依赖海量动态数据的预训练,使模型学会解耦时间流动与空间结构。
- 空间智能的完备性:“新视角预测”被视为空间智能时代的“下一个 Token 预测”,是通往通用人工智能的关键原语。
1. 把每一帧像素钉进真实空间
主持人:Justin,请先介绍 Atlas 的核心功能及其重要性。
Justin Johnson:Atlas 是新一代世界模型,具备生成、重建及模拟世界三大核心能力:
- 基于相机轨迹的条件生成:输入图片与相机运动轨迹,引导模型按指定视角生成连续视频帧。
- 稀疏 3D 重建:输入 1 至 100 张真实视角照片,重建现实空间,输出漫游视频或显式 3D 模型。
- 仿真模拟:支持“子弹时间”视频生成及机器人仿真应用。
主持人:什么是“子弹时间”?
Justin Johnson:源自电影《黑客帝国》,主角 Neo 躲避子弹时,镜头围绕其做全方位环绕拍摄。传统拍摄需上百台相机围成绿幕阵列,而 Atlas 仅需三台普通相机(如 iPhone),无需专业标定,即可重构时间静止瞬间,实现虚拟镜头的自由穿梭。

主持人:如何概括 Atlas 的输入输出逻辑?
Justin Johnson:Atlas 的底层逻辑是“新视角预测”,这是基座模型中前所未有的基础原语。不同于 LLM 的“下一个 Token 预测”或视频模型的“下一帧预测”,Atlas 将场景转化为“空间上下文”,用户可在时空任意位置放置虚拟相机,模型即推断出该视角的世界样貌。
Ben Mildenhall:关键在于空间物理定位(Spatially Grounded)。市面多数视频模型缺乏确切的空间锚点,依赖文本提示词“抽卡”。而在 Atlas 中,每张输入图均绑定三维相机位姿,确保空间重建精度极高,不会盲目猜测物体相对位置。这使得创意构想中的运镜完全受控,摒弃了传统模型“拉老虎机”式的试错过程。
2. 半个世纪的视觉鸿沟:生成与重建的大一统
主持人:这是单纯扩大模型规模,还是架构创新?
Justin Johnson:这是架构层面的根本创新。历史上,3D 重建与内容生成分属不同领域。Atlas 首次在单一架构中联合实现了两者,并原生支持多模态输入:不仅包含文本、图像、视频,更将相机位姿与3D 深度图作为原生模态直接喂入模型。
李飞飞:这是首次真正将“像素生成”与“像素重建”统一。计算机视觉发展五十余年,重建与新视角合成一直是独立赛道。Atlas 以视角估计为锚点,优雅地融合了这两大难题。
主持人:为何说这是通往“空间智能”的关键一步?
李飞飞:空间智能需具备生成空间、空间推理及交互编辑三大能力。其基础在于理解空间几何、三维结构及物理规律。Atlas 的突破在于,它生成的每一帧都携带核心信息——相机位姿。纯粹生成像素仅是第一步,生成具备空间上下文且与物理几何严密锚定的像素,才是质的飞跃。
3. 从两小时扫一套房到只拍三张照
主持人:World Labs 成立仅两个半月,为何能迅速推出如此强大的模型?
李飞飞/Justin Johnson:团队对 Scaling Law(扩展法则)抱有坚定信念。上一代模型 Marble 受限于高斯泼溅(Gaussian Splatting)的输出格式,存在瓶颈。Atlas 重新设计架构,不再强制锁定单一输出格式,而是回归“新视角预测”这一核心原语,使其更具扩展性。
主持人:如何理解从“稠密重建”到“稀疏重建”的跨越?
Ben Mildenhall:传统稠密重建类似医学成像,需覆盖每个角落,往往需拍摄上百张照片,耗时极长。Atlas 将数据需求压缩至原来的 1/50 甚至 1/100,仅需 3 张照片即可完成高质量重建。这得益于模型学会了利用生成机制填补盲区:先通过三角测量还原可见部分,再基于空间上下文合理外推不可见区域。
李飞飞:斯坦福主方院的演示中,仅用地面拍摄的 3-25 张照片,模型便生成了严格的航拍视角,展现了惊人的空间几何遵循能力。
Ben Mildenhall:这与 LLM 的长上下文逻辑一致:重建本质上是在极长上下文中塞入大量视角先验后的生成。Atlas 构建了可平滑扩展的空间上下文窗口,能容纳更多素材并进行合理外推。
4. 给 Scaling Law 投下信任票
主持人:仅凭几张照片就能实现完美的 3D 一致性,秘诀何在?
Justin Johnson/李飞飞:源于对 Scaling Law 的坚定信仰。团队从小模型起步,逐步验证架构可行性。当看到小模型已能生成桌底穿梭等惊人效果时,团队立即确认了方向。目前模型性能主要受限于训练算力,而非架构上限,未来仍有巨大提升空间。
Ben Mildenhall:在创意领域,创作者急需“确定性”。以往 AI 生成的多视角图像往往 inconsistent(不一致),而 Atlas 提供了扎根于 3D 一致性的世界,让用户能像在现实中搭积木一样构建资产。这将极大赋能影视、游戏、建筑及工业设计,降低 3D 建模门槛,释放人类创造力。
5. 机器人最致命的死穴不是芯片
主持人:Atlas 与机器人技术有何关联?
李飞飞:机器人领域当前的最大瓶颈是数据。训练机器人策略需要大量涵盖各种随机变化(如物体位置、形状、光线)的现实数据,采集成本极高。Atlas 的 Real-to-Sim 能力可快速构建高保真仿真环境,提供海量训练数据,加速机器人策略迭代。
Justin Johnson:机器人策略是动态交互的 Agent,需在仿真中经历各种意外情况。传统仿真依赖人工编写规则,而 Atlas 可作为神经仿真器(Neural Simulator),自发理解环境对动作的反应。未来,该仿真器本身甚至可直接成为规划器(Planner),实现理解世界与规划动作的统一。
6. 真正的世界从不静止:在动态中提纯真实
主持人:如何让世界真正“动”起来?
Justin Johnson:Atlas 架构底层已支持动态。虽然发布版本侧重静态场景,但其预训练权重已沉淀了大量动态理解(如水波、车辆运动)。有趣的是,即便目标是静态重建,接触动态数据也能帮助模型更好地解耦时间与空间,从而提升静态几何的精度。
李飞飞:未来的核心是可编辑性(Editability)。即在维持高画质的前提下,赋予用户对场景元素、空间布局、时间流速等的精细控制能力,实现工业级的交互与编辑。
7. 生物为何演化出眼睛?
Justin Johnson:我们提出“新视角预测”具备AI 完备性。如同 LLM 中“下一个 Token 预测”可规约各类智能任务,解决“新视角预测”意味着解决了空间智能的根本问题。
李飞飞:从进化论视角看,大自然赋予动物眼睛而非树木,是因为移动必然带来新视角的预测需求。只要开始在空间中移动,就必须学会预测新的视角。因此,“新视角预测”就是空间智能时代的“下一个 Token 预测”,是通往通用人工智能的关键阶梯。

