大数跨境

AI 开始学习「想象未来」:ECCV 2026背后,中国学者如何卡位世界模型

AI 开始学习「想象未来」:ECCV 2026背后,中国学者如何卡位世界模型 AI科技评论
2026-09-08
20
导读:世界模型开始合流,中国团队正在进入核心问题。
世界模型技术路线迎来合流,中国科研团队正深入核心议题。

    作者丨吴思梦

    编辑丨岑   峰

2026 年 9 月 8 日,全球计算机视觉顶级会议 ECCV 2026 在瑞典马尔默开幕。作为与 CVPR、ICCV 并列的“三大顶会”,本届会议共接收论文 2883 篇(接收率 27.5%)。值得注意的是,在 86 个 Workshop 中,有 13 个直接聚焦"World Models"或"Embodied AI",创下历史新高。Yann LeCun、Jürgen Schmidhuber 等图灵奖得主将发表主题演讲。
从三维理解、视频生成到具身智能与安全评估,世界模型相关议题被集中纳入议程。这标志着 AI 竞争焦点正从“理解世界”向“预测世界”迁移,而中国研究者正试图在这一变革中占据关键位置。

ECCV 2026:为何世界模型成为核心议题?

世界模型并非新概念,其核心思想是让智能体通过预测环境变化来降低试错成本。然而,受限于数据昂贵、物理规律难建模等因素,该方向长期未成主流。近两年,生成式 AI 的突破赋予了模型预测复杂视觉世界的能力,加之机器人与自动驾驶产业对新型学习方式的迫切需求,推动世界模型重回视野中心。
ECCV 2026 关于世界模型的讨论主要聚焦四大核心问题:
构建机制:探讨训练数据的选择,包括是否需要动作数据及三维信息,以构建能理解世界变化的模型。
评价体系:超越单纯的图像质量,转向评估模型对空间关系、物理规律的理解能力及行动结果预测能力。
可靠性:针对自动驾驶等高风险场景,模型需具备自我评估预测可信度的能力。
行动闭环:将预测转化为正确行动,实现世界模型的最终价值。
此次爆发实为三股趋势的合流:一是以 Yann LeCun JEPA 理论为代表的范式转移,世界模型已成主流共识;二是 3D 高斯泼溅(Gaussian Splatting)技术的工程化成熟,为世界模型提供了可计算基座;三是具身智能产业化压力,促使工业界押注"VLA+ 世界模型”以解决泛化瓶颈。

中国学者补齐世界模型三块拼图

在连接“理解、预测、行动”的产业链上,中国研究者正从定义边界、建立评价、落地机器人三个维度切入。

王新超:重新定义边界,从“生成未来”到“行动未来”

针对世界模型定义的争议,新加坡国立大学王新超团队提出 World Action Model(WAM)概念。研究指出,真正面向具身智能的模型,其预测必须进入行动路径。与传统 VLA 模型仅解决“看到什么做什么”不同,WAM 旨在解决“若如此行动,未来将如何”,使机器人具备基于预测的决策能力,以应对无标准答案的现实任务。

陈志波、李新:构建评价体系,从“看起来真实”到“真正可用”

为解决模型“懂不懂世界”的难题,陈志波团队提出 4DWorldBench,将评价指标扩展至空间结构、时间连续性、物理规律及任务支持度。此外,其与李新团队探索的 VLA-JEPA 模型,通过在视觉语言行动模型中引入潜空间世界模型,让机器人在行动前先推演未来状态,实现了从即时反应向预测式决策的跨越。

杨高、梁晓丹:推动工程落地,让世界模型进入机器人

杨高与梁晓丹重点关注世界模型的工程化落地。杨高致力于利用大规模数据提升机器人泛化能力;梁晓丹(中山大学)则聚焦物理具身基础模型,强调预测“会发生的世界”而非“像真的视频”。其团队推出的 eWAM、ProPhy 等工作,通过将物理先验注入视频生成或将世界模型与 VLA 原生融合,正在改写世界模型的边界,使其成为机器人感知、决策与生成的共同约束。

结语:产业拐点已至

世界模型的竞争焦点已从“生成好看的未来”转向“预测会发生的世界”。中国研究者在边界定义、评价体系及机器人落地三个维度的突破,实为同一命题的不同侧面。随着学界、产业界与监管者目光的汇聚,世界模型已不仅是研究方向,更是 AI 产业发展的关键拐点。
【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8937
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读236.3k
粉丝0
内容8.9k