问道AI+
2026年,世界模型受到行业高度关注,进入技术与产业双重聚焦。据CB Insights统计1,世界模型领域投资额从2024年的14亿美元跃升至2025年的69亿美元。6月,世界经济论坛首次将世界模型列入年度十大新兴技术榜单2。
现阶段,世界模型概念尚未达成统一,但能力认知进一步深入,在表征世界、模拟预测、行动规划等方面共识渐显。人工智能科学家李飞飞2026年6月以“空间智能”概括世界模型能力,按渲染器、模拟器、规划器将世界模型功能分为三类3,其中模拟器的模拟预测功能是关键,可从中推导行动规划、渲染环境外观;谷歌DeepMind 2025年8月将世界模型界定为能够模拟环境演化与行动后果、支撑智能体预测的AI系统4;清华大学FIB-Lab5等从应用模式维度将世界模型分为数据引擎、环境模拟器和动作规划器;杨立昆(Yann LeCun)主张世界模型应在抽象表征空间预测世界状态。
从技术实现路径看,当前世界模型尚未形成单一主导范式,而是呈现多路线并行、相互融合的发展特征。一是动作条件视频生成路线,学习动作条件下的世界演化规律,生成结果必须受输入动作控制并保持长时一致。谷歌Genie 3实现720p分辨率下24帧每秒的实时交互漫游、一致性达数分钟6。二是抽象表征预测路线,在潜空间预测重要信息变化,无需逐像素重建。Meta V-JEPA 2仅用62小时机器人视频训练即实现机械臂零样本抓取规划7。三是3D/4D空间路线,显式对三维空间进行重建与仿真。World Labs 发布的Atlas,将文本、图像、视频、相机位姿与深度等输入锚定到三维空间8。四是基于物理引擎生成的路线,将大模型与物理引擎融合,由物理引擎提供符合物理规律的可交互仿真环境,使生成与推演锚定物理规则。卡内基梅隆大学等机构开源Genesis,2026年仍保持高频迭代9,英伟达开源同类物理引擎Newton 1.010正式版。五是世界动作模型(WAM)路线,将世界预测与动作生成统一建模,联合预测下一帧观测与下一步动作。英伟达DreamZero新任务与新环境泛化能力较已有最优VLA模型提升超2倍11。
世界模型能力仍面临明显短板,制约其模拟预测与行动规划等关键能力。一是物理规则理解能力不足,在质量、摩擦、刚性、重力等基本物理属性上易出现错误,形成“视觉合理性陷阱”12;二是因果推理能力薄弱,多数模型学到的仍是“给定状态与动作、接下来通常发生什么”的相关性,而非“主动改变某一变量将造成什么结果”的干预与反事实能力,输入动作对生成结果的真实控制仍较为有限。三是记忆能力有限、长时一致性不足,当前交互式世界模型的连续一致性仍停留在数分钟量级、长程推演中单步误差不断累积,尚难以持续运行13。
世界模型的发展需从关键技术与基准测试双线推进。关键技术方面,一是推动生成式模型与物理引擎、显式物理状态融合,锚定物理规则。高德ABot14具身智能体系则为机器人构建遵循物理定律的高拟真虚拟世界,支撑无限次安全试错与经验迁移。二是主动推理补齐因果短板。Aether AI 2026年7月公布CD-LAM15,通过对隐动作进行因果去偏将动作跟随误差降低超30%。三是以潜空间紧凑表征与高效架构抑制长程误差累积,Waymo 2026年2月发布的世界模型高效变体已支持长时推演16,智元机器人GE-Sim 2.0在单卡上实现25帧推演2.3秒。基准测试方面,针对当前世界模型在物理理解、因果推理、长时一致性等方面仍存在的能力短板,加快构建可度量、可验证、可比较的测试评估体系,通过评测准确识别模型能力边界和关键短板,为技术迭代优化提供依据。中国信通院人工智能研究所依托具身智能基准测试(EAI Bench),已形成系统化世界模型评测能力,围绕视觉生成、物理规律、环境演化、动作因果、三维空间关系以及长时稳定性等关键能力开展综合评价,支持不同技术路线、不同模型之间的横向比较,帮助行业识别不同技术路线的能力边界与适用方向,甄别具有真实能力优势的模型和技术积累扎实的企业。未来,将联合产业、高校和科研机构持续完善评测数据集、指标体系和测试方法,动态跟踪世界模型技术演进与能力变化,以评测牵引模型能力优化和技术路线迭代,为产业应用和规模化落地提供可信评价依据。
作者:邬京耀 李碧莹 白入文
参考资料
1https://www.cbinsights.com/research/the-physical-ai-models-market-map/
2https://www.frontiersin.org.cn/%e4%b8%96%e7%95%8c%e7%bb%8f%e6%b5%8e%e8%ae%ba%e5%9d%9b%e6%90%ba%e6%89%8b-frontiers-%e5%8f%91%e5%b8%83-2026-%e5%b9%b4%e5%8d%81%e5%a4%a7%e6%96%b0%e5%85%b4%e6%8a%80%e6%9c%af-%e7%a7%91%e6%8a%80%e8%a7%92
3https://www.worldlabs.ai/blog/taxonomy-of-world-models
4https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/
5https://www.preprints.org/manuscript/202604.0928
6https://blog.google/innovation-and-ai/models-and-research/google-deepmind/project-genie/
7https://mp.weixin.qq.com/s/jUwUAFrYuvCEm7CjS2lXPg
8https://www.worldlabs.ai/blog/atlas
9https://github.com/Genesis-Embodied-AI/Genesis/releases
10https://developer.nvidia.com/blog/newton-adds-contact-rich-manipulation-and-locomotion-capabilities-for-industrial-robotics/
11https://dreamzero0.github.io/
12https://hai.stanford.edu/policy/the-world-model-and-spatial-intelligence-era-governing-ai-beyond-language
13https://arxiv.org/abs/2606.00133
14https://mp.weixin.qq.com/s/SYiN5eoz9_LbJ2iXnoTlOQ
15https://aetherlabs.ai/articles/cd-lam-causal-debiasing-for-embodied-world-models
16https://waymo.com/blog/2026/02/the-waymo-world-model-a-new-frontier-for-autonomous-driving-simulation/

