当世界模型成为通往AGI的共识,一个核心问题随之而来:AI究竟该以何种方式在脑海中构建和推演未来?目前,业界并未形成大一统的标准答案,而是分化出多条各具特色的技术路线。这些路线在底层逻辑上的分野,折射出对“智能”本质的不同理解。
生成式视频派
这一流派的核心逻辑是“能够生成逼真视频就意味着理解了物理规律”。代表产品如Google的Genie系列和OpenAI的Sora,它们通过Diffusion Transformer等架构,直接生成视觉上一致、时序连贯的视频序列。
其优势在于直观、易理解,且商业化路径清晰,可直接应用于内容创作与交互仿真。但短板同样明显:它试图在充满不确定性的物理世界中精确预测每一个像素,不仅算力消耗极其恐怖,且往往只学到了世界的“皮相”,缺乏对底层物理规律的真正理解,难以支撑机器人训练等硬核场景。
JEPA认知派
由图灵奖得主Yann LeCun提出的联合嵌入预测架构(JEPA),是生成式路线的“反叛者”。JEPA的核心思想是:放弃像素级的细节重建,专注于在抽象的表征空间中预测未来状态。
打个比方,人类开车时不需要在脑子里实时渲染路边每片树叶的轨迹,只需抽象出“前方有障碍物,需要减速”的核心信息。JEPA正是模拟这种人类认知方式,将视觉信息压缩为高度概括的数学表征,再进行因果推演。Meta发布的V-JEPA 2便是该路线的代表,它不仅计算效率极高,还能让机器人实现零样本控制。其劣势在于放弃了可视化生成,人类难以直观看到其思考过程,商业化落地尚需时日。
空间智能派
如果说JEPA关注“时间预测”,李飞飞创立的World Labs则盯上了“空间重建”。该流派认为,真正的智能需要对三维世界有显式的理解,包括几何结构、深度关系与物体相对位置。
通过3D高斯溅射(3DGS)或NeRF等技术,World Labs的Marble模型能直接从文本或照片生成可漫游、可编辑的3D环境。这种做法的优势是视觉直观,且与现有游戏引擎工作流无缝对接,工程化落地快。但挑战在于,维持高分辨率3D场景的渲染参数演化复杂度呈指数级爆炸,且同样面临物理规律内化不足的难题。
硬核物理与科学计算派
这一阵营由计算物理学家和传统图形学家组成,他们坚信牛顿、纳维等先贤推导出的物理方程是不可亵渎的。与其让神经网络用海量数据去“瞎猜”物理规律,不如直接把方程当作硬约束写死在系统里。
其核心逻辑是“引擎负责确定性物理,神经网络只负责计算不确定性”。通过将可微分物理引擎作为硬先验嵌入网络,无论神经网络如何发散,底层的重力参数都被死死锁定。这种路线在科学计算和工业仿真中展现出极高的严谨性,但通用性和泛化能力相对受限。
结语
从像素级的生成式预测,到抽象空间的JEPA推演,再到显式的3D空间重建与硬核物理约束,每条路线都在搭建不同功能的“地基”。当前,一个明确的趋势正在凝聚:工业界开始放弃单模型包揽一切的想法,探索将系统拆分为负责底层物理推演的“推理器”与负责视觉渲染的“生成器”的前后端分离架构。
通往更高阶智能的道路,必须向下扎根。当这些流派最终走向融合,AI将真正拥有理解时空、因果和物质连续性的“物理直觉”,在说出答案之前,先在内心的微型剧场里让水泼出、让球落地。
推荐阅读
文案:MS通用大模型
编辑:Luyee
关注我们,了解更多知识
成都麦思多维科技有限公司
成都麦思多维科技有限公司成立于2016年,是一家专注于为教育行业提供整体解决方案的科技公司,以创新技术研发和应用为核心,聚焦数据科学、人工智能、虚拟仿真、智慧教学在教育行业的综合应用,与多所985/211高校、国家双高职业院校、政府主管部门、行业头部企业深入合作,不断探索政产学研用创新合作模式,在全国拥有丰富项目案例。
公司总部位于成都,设立重庆分部,麦思多维是国家高新技术企业、科技型中小企业,四川省创新型中小企业及四川省数据企业,核心管理层具有国内大型高科技公司行业背景,研发团队由国内知名高校博士和硕士团队领衔组成,拥有核心知识产权,全体员工均具备本科及以上学历。公司在本科与职业院校咨询规划与教学实践领域有国内权威专家支撑,服务院校教学改革、学科建设与人才培养。
公司官网:https://www.maxsdsp.com/

