大数跨境

对话清华赵昊:物理AI,胜负关键在4D可控的世界模型基模

对话清华赵昊:物理AI,胜负关键在4D可控的世界模型基模 DeepTech深科技
2026-07-23
3
导读:AI真的理解世界了吗?4D世界模型给出了另一种答案。

当前,世界模型已成为 AI 领域的核心议题,但关于其定义的行业共识尚未形成。一种观点认为其仅是视频生成的延伸,另一种观点则强调只有理解物理规律并支持机器人行动的系统才配称为世界模型。

清华大学智能产业研究院(AIR)助理教授赵昊提出了“原生 4D 世界模型”的概念。他认为,仅生成视觉连贯的视频不足以证明模型理解了世界。面向自动驾驶和机器人的世界模型,必须能够描述几何结构、时间维度、光学属性以及物体间的力学关系。

从室内布局、三维场景理解到 NeRF、自动驾驶仿真,再到 4D 生成与机器人策略学习,赵昊的研究路径完整覆盖了空间智能的演进过程。

(来源:受访者)

本次对话旨在探讨:为何必须是 4D?这条强调显式几何与物理表征的技术路线,究竟是下一代基础模型,还是大规模视频模型成熟前的过渡方案?

从场景理解到 4D 世界模型:技术演进路线

DeepTech:在 AI 从感知迈向理解与干预的过程中,三维场景生成、神经渲染与生成式仿真三者关系如何?

赵昊:从三维场景理解延伸至三维场景生成是自然趋势。早期计算机视觉聚焦于服务于自动驾驶的三维场景理解,随后扩展至生成领域。神经渲染是三维生成的关键技术,而生成式仿真则是前两者的综合应用。

DeepTech:多模态大模型如何从语言模型演进至 4D 世界模型?

赵昊:多模态大模型的演进经历了数代更迭,各阶段面临不同瓶颈:

图丨多模态原生 4D 世界模型基模的演进(来源:受访者)

  • 第一代(语言 Token):ChatGPT、Llama 3 为代表,解决语言理解与推理,但受限于互联网语料耗尽,难以通过原有范式继续提升。
  • 第二代(图像 + 文本 Token):以 GPT Image2.0 等为代表,实现图文理解与编辑,但仍无法解决物理世界的真实问题。
  • 第三代(视频 Token):引入 Sora 等模型,开始处理时间动态与动作连续性,但尚未完全成熟。
  • 第四代(3D Token):关注空间结构与物理属性,如 Trellis.2。
  • 第五代(4D World Token):整合空间、时间、物理与交互。这是 AI 演进的终极方向:从理解语言图像,到推演物理世界并驱动智能体行动。

DeepTech:Dexora、Trellis.2 及机器人生成式机械设计等成果在技术路线中扮演何种角色?

赵昊:

  • Dexora:首个原生支持双臂双手高自由度操作的开源 VLA 系统。通过混合遥操流程和判别器加权训练,利用 1 万条真机数据验证了仿真数据对高自由度灵巧手操作的有效性。
  • Trellis.2:原生物理光学属性的高分辨率 3D 生成基模。其核心是通过 O-Voxel 表征,将几何信息及透明度、粗糙度、金属感等光学属性全部编码为原生 3D Token,解决了结构化隐式表征难题。

图丨O-Voxel 示意图及 3D 资产与 O-Voxel 之间的即时双向转换

  • 生成式机械设计:针对对话式动画机器人的面部机制自动合成系统。输入二维人脸肖像,即可生成包含内部机械结构的三维模型及实时表情。该系统将专业机械设计时间从 22.8 小时缩短至 11.7 分钟。

DeepTech:为何世界模型能成为连接机器人、3D 生成等方向的共同底座?

赵昊:无论是编程 Agent 还是多模态模型,若缺乏对物理环境状态变化的反馈能力,便无法解决具身智能和自动驾驶的核心问题。世界模型通过刻画物理规律,成为 Physical AI 的基础。Dexora 利用仿真数据训练决策模型,Trellis.2 的原生 3D Token 则为下一代多模态模型提供了物理属性支撑。

DeepTech:自动驾驶世界模型从论文到商业化产品为何存在距离?

赵昊:主要原因在于产业周期与技术范式的收敛。过去三年,技术路线不断演进,直到如今基本原理已确立,范式趋于收敛。现阶段已具备通过持续的数据、算力投入及工程迭代,将自动驾驶世界模型推向量产的条件。

图丨OmniNWM 长时序多视角多模态精准控制的可量产自动驾驶世界模型

此前未大规模延伸是因为技术方案未收敛。如今范式明确,正是 Scale up 的关键窗口期。

DeepTech:您的技术路线是预先规划还是随行业发展收敛而成?

赵昊:这是一条清晰且既定的路线。早在博士期间,受 SIGGRAPH 经典论文《Rendering Synthetic Objects into Legacy Photographs》启发,便确立了“先三维场景理解,后三维/四维生成”的路径。视频生成与具身智能的兴起,进一步验证了该路线的可行性。

DeepTech:学院派推动世界模型商业化的优势何在?

赵昊:AI 属于典型的技术驱动型产业,如同 OpenAI 之于 GPT。相比产品驱动型(如腾讯、字节)或平台驱动型(如阿里)公司,学院派在全明星科学家团队和底层技术创新上具有天然优势。从 Siri 到 GPT 的转变,本质上就是从产品定义向技术定义的跨越。

什么是真正的 4D 原生?

DeepTech:到底什么是世界模型?

赵昊:世界模型的核心是刻画世界的变化,即从 State t 到 State t+1 的演进。不同模型的区别在于状态表达的维度:一维(语言)、二维(图像/视频)缺乏四维物理世界所需的物理与光学属性表征,难以真正刻画世界变化且不可解释。唯有四维表征具备可解释性、明确性与可靠性,能从根本上解决物理 AI 问题。

DeepTech:为何三维加时间轴不算真正的 4D 世界模型?

赵昊:纯三维加时间轴仅是"3.5D"模型,因为帧间缺乏光学和力学联系。真正的 4D 原生模型必须包含力学属性(如杨氏模量、密度、动量)和光学属性,使时间轴上的每一帧通过物理规律紧密关联,从而完整表达物体状态、身份及运动轨迹。

DeepTech:为何要将连续的物理世界 Token 化?

赵昊:Token 化是现代多模态大模型的惯例。无论是三维模型(Trellis.2)还是视频(Sora),均需通过 VAE 等技术离散化为 Token 进行处理。在量子计算等新架构突破前,将连续物理世界 Token 化仍是必经之路。

DeepTech:面向智能体的世界模型是否必须提供奖励信号?

赵昊:是的。奖励必须在 4D 表征上才能被准确定义。一维或二维表征无法理解空间关系或“轻重快慢”等物理概念。完整的 4D 表征有助于将奖励定义得更明确、更具可解释性,从而指导智能体行动。

技术路线之争:几何、查询范式与 Scaling Law

DeepTech:几何先验是长期壁垒还是数据不足时的“拐杖”?

赵昊:几何先验绝非“拐杖”。未来四维世界模型将是“重”模型,而二维模型可能是从中提取的“轻”模型。即使纯二维大模型路线可行,也需依赖四维模型生成的海量数据进行训练。四维模型具备降维能力,而二维模型无法升维,因此四维路线具有不可替代的长期壁垒。

DeepTech:查询式几何是否会取代显式三维重建?

赵昊:需区分架构与表征。Query-based Transformer 是架构,而四维是表征(输出)。模型必须具备四维表征,架构负责将其解码。两者并非对立,而是协同工作。

DeepTech:视频生成模型扩大规模后能否自然演化成世界模型?

赵昊:Genie 3 等模型若要成为真正的世界模型,必须在扩大数据的同时引入四维表征。我们的 OmniNWM(六视角 Genie 3)和 LightX(双可控 4D 视频生成)即是四维版本的实践。单纯扩大数据而不增加物理表征,无法突破物理规律的限制。

DeepTech:传统仿真引擎为何还需要世界模型?

赵昊:传统仿真引擎在处理湍流、疲劳等复杂物理规律时存在局限,无法完美刻画 State t 到 State t+1 的变化。第五代世界模型通过将一切 Token 化,让神经网络直接学习物理规律,旨在解决传统引擎无法建模的微妙问题。

DeepTech:如何确定哪些误差可容忍?

赵昊:应秉持"Bitter Lesson"和 Scaling Law 思路,追求能够理解所有物理规律的通用基模。如同 GPT 囊括所有知识后降维打击子任务,4D 世界模型也应奔着最高目标,实现对所有物理细节的刻画,从而降维解决机器人和自动驾驶的具体问题。

数据与学习:因果与行动能力的获取

DeepTech:起步阶段最稀缺哪类数据?

赵昊:仿真数据至关重要,因其几何和速度信息绝对精准,而真实数据重建往往存在误差。尽管存在 Sim-to-Real 差距,但可通过在真实数据上进行自监督学习来缩小。特别是在接触力学仿真(如 RTX-IPC)中,仿真数据能提供高效且精准的底层计算支持。

DeepTech:世界模型在自动驾驶中替代哪些环节?

赵昊:目前已在长尾场景生成、安全评测及感知训练中落地。面向 L4 级自动驾驶,核心思路是先训练一个具备四维表征的世界模型基模(如 OmniNWM),车企在此基础上进行强化学习,从而实现闭环评测与量产。

DeepTech:合成数据回流是否会导致错误放大?

赵昊:仿真数据本身无逻辑错误,仅有 Sim-to-Real 差距;真实数据无此差距但可能有噪声。通过混合训练与自监督机制,可有效利用两类数据的优势,持续提升模型性能,避免误差累积。

质疑、评测与未来挑战

DeepTech:目前有哪些工业落地案例?

赵昊:主要集中在自动驾驶及 3D 打印内容生成等弱接触场景。涉及具身智能复杂接触力学的场景,交付难度较大,但 L2 至 L2.99 级别的自动驾驶已有成熟合作案例。

DeepTech:对世界模型最有分量的质疑是什么?

赵昊:主要在于模型误差的积累。现有模型难以在超过 1 分钟的尺度上持续保持身份、几何、物理和交互的一致性。突破这一限制可能需要 GPU 算力的根本性突破,而 4D 表征是目前最有前景的解决路径。

DeepTech:如何评测模型是否真正理解物理世界?

赵昊:最终的评测标准应与 4D 世界模型对齐。虽然目前缺乏统一的大规模评测,但具备 4D 表征的模型本身就蕴含了对物理世界的深层理解,应作为行业通用的对齐基准。

DeepTech:未来三年哪项判断最可能被证伪?

赵昊:几何先验、4D Token、Query 架构及奖励机制在原理上均成立。唯一的不确定性在于“跨行业基座模型”的实现难度,未来三年可能会被认为过于困难而暂缓。

DeepTech:是否有 Plan B?

赵昊:第五代多模态大模型实际上囊括了前四代所有路线(语言、图像、视频、3D、4D)。这些并非互斥的选项,而是通往终极目标的子集与折中方案,因此不存在单一的 Plan B。若某些子集率先产生巨大商业价值,团队将优先聚焦于此。

注:封面由 AI 辅助生成

【声明】内容源于网络
0
0
DeepTech深科技
DeepTech 是一家专注新兴科技的资源赋能与服务机构,以科学、技术、人才为核心,通过科技数据与咨询、出版与影响力、科创资本实验室三大业务板块,推动科学与技术的创新进程。DeepTech 同时是《麻省理工科技评论》中国区独家运营方。
内容 5581
粉丝 2
DeepTech深科技 DeepTech 是一家专注新兴科技的资源赋能与服务机构,以科学、技术、人才为核心,通过科技数据与咨询、出版与影响力、科创资本实验室三大业务板块,推动科学与技术的创新进程。DeepTech 同时是《麻省理工科技评论》中国区独家运营方。
总阅读95.0k
粉丝2
内容5.6k