躲猫猫不仅是儿童游戏,更是人类建立“物体恒存”认知的起点。婴儿通过观察构建世界运行的内部模型,理解即使物体脱离视线依然存在的规律。然而,当前人工智能系统虽擅长对话与模式匹配,却难以掌握这一基本认知,无法理解隐藏概念或预判行为后果。
当前的人工智能系统难以预测后续发展。研究人员希望改变这一现状。图片来源:Illustration by Max-O-Matic for Fortune
业界普遍认为,“世界模型”是破解该难题的关键。这类系统不再局限于识别文本或图像模式,而是旨在模拟物理世界的运行规律。通过海量视频训练,世界模型能构建包含物理法则在内的精确内部图景,成为自动驾驶、具身机器人及医疗手术模拟等技术的核心基石。
明星力量
为满足“物理人工智能”的构建需求,世界模型已从冷门科研方向跃升为研发重心。谷歌近期发布"Project Genie"研究预览,该系统可根据提示词生成逼真的交互式虚拟环境,并预测其演变过程以响应用户操作。
与此同时,AI 领域领军人物纷纷入局。斯坦福大学教授李飞飞于 2024 年创立 World Labs,致力于赋予 AI 更丰富的三维空间感知能力;Meta 前首席科学家杨立昆则在今年 3 月创立 AMI Labs,旨在突破大语言模型的局限。两人各自为新创企业筹集了约 10 亿美元资金。
杨立昆指出:“现有系统能操控语言让人误以为其很聪明,但在面对物理世界时却束手无策。”这一趋势反映了智能认知的革新:从基于数据响应或试错学习,转向通过模拟环境来掌握世界运行规律。正如英伟达 Cosmos Lab 副总裁刘洺堉所言,世界模型如同“生成式训练基地”,让 AI 在虚拟场景中提前规划与练习,再应用于现实世界。
第四维度
除头部项目外,多家新创企业正沿不同技术路线探索世界模型。
Niantic Spatial 利用超过 300 亿张实景照片和三维扫描数据,打造大型地理空间模型,以三维形式解读现实环境;以色列公司 Decart 专注于实时应用,其系统能随用户交互持续生成并更新环境,实现视频逐帧匹配操作,已应用于虚拟试穿及直播背景切换等场景。
在某些模型中,时间构成了不可或缺的“第四维度”。由自动驾驶先驱奥利弗·卡梅伦和杰夫·霍克创立的 Odyssey 公司,专注于构建能预测世界随时间演变的模型,直接从视频中学习物理规律、人类行为及因果关系。卡梅伦表示:“若能将此能力应用于机器人、游戏、教育及国防等领域,将带来颠覆性变革。”
"ChatGPT 时刻”
尽管前景广阔,构建世界模型仍面临巨大的技术与经济障碍。相比语言模型,模拟真实世界的系统需处理高分辨率视频,对算力要求极高。例如,访问 Odyssey 2 模型的每位用户可能需占用一块售价高达 4 万美元的英伟达 H200 芯片。
此外,数据也是制约因素。世界模型高度依赖视频素材,其采集、标注与规模化训练难度远超文本。然而,挑战并未阻挡研发热情。随着技术推进,业界普遍认为突破性进展近在咫尺。刘洺堉表示,物理人工智能领域的"ChatGPT 时刻”即将到来,未来的目标是让机器人仅通过少量示例甚至零样本即可学会并持续运用新技能。
·技术范式革新:AI 正从文本处理演进至能理解物理规律、预测环境变化的“世界模型”,有望重塑自动驾驶、具身机器人及医疗等实体产业的底层竞争格局。
·顶级资本与学术领军人物齐聚新赛道:以李飞飞和杨立昆为代表的 AI 领军人物下场创业,英伟达等算力巨头全力布局,预示全球 AI 产业下一波爆发点将聚焦于空间感知与物理交互能力。
·算力与数据壁垒揭示真实商业门槛:世界模型对视频数据与实时算力的要求远超大语言模型,物理 AI 爆发前夕仍面临高昂的硬件与计算成本考验。
(财富中文网对原文有删减和调整)
编辑:魏雨彤
诚邀各领域优秀企业参与申报

