大数跨境

李飞飞手握Atlas微微一笑,把微软桌子掀了

李飞飞手握Atlas微微一笑,把微软桌子掀了 猛犸AI智能体 MMAI Studio
2026-09-02
2

前脚友商还在为生成几秒钟的“电子榨菜”视频卷到头秃,后脚李飞飞创办的World Labs微微一笑,把桌子掀了——就在刚刚,全球首个多模态世界模型Atlas正式登场。

按照官方定义,Atlas是一款面向空间智能的omni world model,从零开始完成预训练,可以原生处理文本、图像、视频、相机位姿与3D深度信息,并在同一套模型中完成世界生成、空间重建和时空模拟。



李飞飞本人直接一手置顶:“Atlas为从视觉特效到机器人的众多应用场景打开了大门。”高徒Jim Fan也来捧场:“这是机器人领域Real-to-Sim的一大步。”

一张图,脑补整个世界

以前玩视频生成模型,多少有点玄学抽奖。在Prompt框里卑微敲下“镜头缓慢向左拉升、绕着人物微仰角旋转”,回车之后全凭老天保佑。

Atlas的做法则是:直接把“相机位姿参数”当作底层原生输入。你要什么角度、什么轨迹、走多快?直接给坐标!

只要丢进去1到6张普通照片,定好运镜轨迹,Atlas就能生成最长达1分钟、1440p分辨率的大片。画面不崩,空间几何丝滑一致,堪称外挂级运镜。


更夸张的是它的空间“脑补力”。输入一张只拍到机器人正面的照片?Atlas能把人家背影完完整整脑补出来;给一张泳池边角照?它靠着“世界常识”,默默帮你把没拍到的草坪和远山修好了。

几张照片,省掉几百个机位

传统3D高斯泼溅或者点云扫描,得扛着专业设备围着目标转几十圈,拍几百上千张照片,费钱又费腿。

Atlas再次露出神秘的微笑:一边去,哪来这么多规矩。

官方直接甩出斯坦福大学Main Quad的案例——只需2到25张游客视角的地面平拍照片,就能轻松还原草坪、拱廊和纪念教堂的全部细节,镜头随后拔地而起,来了一段上帝视角航拍漫游。

官方数据显示,在DTU、ETH3D、ScanNet等多个稀疏视角重建基准上,Atlas的平均误差比当时领先的专用三维重建模型还低约12%。



第三方测评中,75%的评测者选Atlas胜过MiniMax H3,81%选它胜过Gemini Omni Flash。

能“暂停时间”的世界模型

Atlas的第三张王牌是时空模拟。它可以根据输入视频同时建模空间和时间,转换已有视频的观察视角,制作具有戏剧性的视觉效果。

测试结果显示,Atlas对摄像机指令的遵循度更高,在复杂轨迹下优势更明显。

技术底牌:多模态自回归扩散Transformer

Atlas是一个全能模型(omni model),目标是在统一架构中同时处理多任务、多种输入输出。团队为其设计了全新的基础架构——多模态自回归扩散Transformer。

文本、图像、视频、3D数据……各种输入都会被锚定在三维空间中,形成空间上下文。就像大模型看上文接下文,Atlas给每张图片绑死三维坐标和深度,在脑子里搭出一个带轴网的房间。


更绝的是,你可以把两张毫无关系的参考图片放进同一个上下文,分别指定它们在3D空间中的位置,Atlas就能把它们缝合成一个空间自然、连续的世界。导演系同学看到这里,战术沉默,缓缓打出一个问号:合着以后运镜不用实拍,直接在电脑里“云开机”就完事了?

机器人训练的“虚拟道场”

对于具身智能和机器人领域,Atlas的价值同样炸裂。仅需喂几张照片,它就能生成逼真的RGB和深度数据,让机器人在更多不同的模拟空间中进行训练和测试。

目前部分合作伙伴已获得Atlas抢先体验资格,未来几周将开放早期访问。World Labs官方表示,Atlas将成为未来版Marble以及其他产品的底层模型。

大模型理解了文字,而Atlas——开始理解世界本身。


【声明】内容源于网络
0
0
猛犸AI智能体 MMAI Studio
专注AI智能体实战教学,从理论到实践,从入门到精通分享落地AI系统、实战案例、落地方法。 让每个人都能在AI时代找到自己的价值。 关注我,一起玩转AI智能体!
内容 170
粉丝 0
猛犸AI智能体 MMAI Studio 专注AI智能体实战教学,从理论到实践,从入门到精通分享落地AI系统、实战案例、落地方法。 让每个人都能在AI时代找到自己的价值。 关注我,一起玩转AI智能体!
总阅读3.3k
粉丝0
内容170