近日,在 WAIC 现场,清华大学车辆与运载学院、人工智能学院教授李升波发表主题演讲《迈向泛在具身智能之路:物理原生的世界模型、数据结构与训练算法》。他提出“物理原生智能”(Physics-native Intelligence, Phi)概念,系统阐述其核心特征与技术体系,为破解具身智能根本性难题提供全新范式。
李升波指出,物理原生智能具备三项核心特征:第一,利用状态而非观测表征世界,且状态需解耦,由物理模型的“显状态”和神经网络的“隐状态”构成,兼顾准确性与泛化性;第二,模型结构满足时序性和因果性,遵循时序优先原则,动作规划减少对未来信息的依赖;第三,训练过程嵌入底层物理规律约束,如对称性、守恒性及动力学系统的辛几何结构等。
以下内容根据李升波教授现场演讲整理,略有删节:
AI 的终极目标:通用化与具身智能
人工智能是当今最重要的技术方向。过去十年,从 ResNet、AlphaGo 到 ChatGPT、DeepSeek,每一次里程碑事件都引发全球关注。我们研究 AI 的核心目的,是让智能更加“通用化”。唯有具备通用能力,方能称之为智能。无论是视觉、语言还是多模态智能,均在追求这一目标。
作为当前热点,具身智能同样以通用化为目标。人类是具身智能的典型代表,通过与环境交互、感知世界、逻辑决策并执行动作来影响物理实体。具身智能体影响的物理实体越多,其通用化能力与智能性越强。
具身智能并非新概念,汽车工程师是最早的实践者。自动驾驶是首个量产化的具身智能系统,而机器人是当前焦点。未来,世界或许将与一切可交互的物理实体接触,形成泛在的具身智能世界。
通用具身智能开发的巨大挑战
开发通用化具身智能面临巨大挑战,难度远超视觉和语言领域。目前自动驾驶仅达 L2 级辅助,尚未实现 L4 级能力。相比汽车,机器人自由度更高、场景更复杂、交互对象更多样,开发通用具身智能体是学术界与工业界的重大难题。
当前技术路线仍以端到端模型训练为主。汽车需百亿级参数和亿级驾驶片段,而机器人因本体与场景复杂,需万亿级参数和千亿级交互片段,训练难度至少是汽车的十倍。若沿用现有大模型训练思路,难以实现通用化目标。
物理原生智能(Phi)的核心范式
借鉴 McCarthy 的世界表征、Pearl 的因果关系及 Hopfield 的物理系统属性等思想,结合近年技术进展,我们提出了“物理原生智能”(Phi)。这是一种更依赖物理规律、旨在更好与物理世界交互的具身智能。它虽仍基于数据驱动的端到端架构,但在世界模型、数据结构和训练算法三个维度,深入考量了物理实体的客观要求:数据稀缺、高功能安全性及训练的稳定性与长期性。
Phi 的具体特征包括:以解耦的状态表征系统动力学,而非传感器观测值;模型结构设计满足时序性和因果性;采用底层物理规律规范训练过程,以匹配物理世界特性。
三大核心特征详解
首先,系统状态由两部分构成:显状态服从系统动力学与物理约束,确保状态转移长期稳定;隐状态服从物理规律驱动的受控转移,确保长期推演不漂移。
其次,模型需满足时序优先,原因先于结果,状态预测不依赖未来信息;具备干预敏感性,动作输入改变应产生可解释的状态差异;支持反事实推理,关注负样本的信息收益。
最后,训练过程需遵循对称守恒,由对称性决定的物理量应守恒或受控变化;保持结构稳定,训练动力学应维持几何结构和能量收支规律。
全新的训练范式与方法论
物理原生智能需要全新的训练范式。一方面,采用虚实混合数据解决物理世界数据匮乏难题;另一方面,彻底采用阶梯训练技术,分阶段逐步提升性能,而非指望一蹴而就。建议将训练分为三个阶段:监督学习预训练、强化学习后训练、强化学习真机微调。各阶段的数据列表、性能指标及训练算法需根据实际情况调整。
世界模型:强化因果律与结构化输入
世界模型是物理原生智能的核心。针对朴素世界模型、世界动作模型及受控世界模型在长程化、精细化动作输出上的不足,物理原生世界模型更强调因果律。它以显式和隐式两类状态为转移动力学核心,前者嵌入物理动力学模型,后者利用神经网络构造。策略与评价模块直接与状态关联,而非观测值,这种结构化输入显著提升了动作准确性、功能安全性与可解释性。
数据结构:三要素融合
物理原生数据包含三要素:从当前观测到下一观测的转移数据、奖励信号 r 以及人类经验知识 K。无论是互联网视频、Ego/UMI 数据,还是真机操作或仿真合成数据,均可通过数据重构、时空对齐和质量增强,转化为结构一致的物理原生数据。转移特性支撑编解码器及受控转移模块训练;奖励信号通过强化学习提升策略性能;人类经验知识则借助大模型评价能力,嵌入模型以支持性能提升。
训练算法:嵌入物理规律与安全保障
物理原生算法设计首要要求是嵌入训练动力学的底层规律,特别是结构对称守恒特性。将广义能量守恒、辛几何结构保持等性质强制嵌入算法,可极大提升训练系统的稳定性。
其次是绝对安全保障能力。真机训练中,每一代模型均需满足安全硬约束。这要求同时训练最优策略及其运行的可行区域,通过博弈机制平衡可行域扩大与环境认知不确定性,确保学习过程中的绝对安全。
第三项需求是抗遗忘能力。鉴于具身智能数据稀少且任务多样,训练需多阶段分步实施。关键在于构建抗遗忘条件及梯度正交机制,确保后续训练不丢失前期性能,实现持续进化。
GOPS 平台与核心算法创新
基于上述框架,清华大学研究组自主研发了面向具身智能的通用训练平台 GOPS(General Optimal Control Problem Solver)。该平台以用户定义的任务和约束为输入,自主组织数据生成、建模、任务转化、网络构建、优化求解及部署集成,形成从研发到应用的全流程闭环,旨在降低开发门槛,提升效率。
GOPS 内嵌了一系列物理原生算法:DSAC 通过连续值分布建模缓解策略高估;RAD 将辛结构守恒融入自适应优化器;LipsNet 结合傅里叶滤波与李普希兹约束缓解动作震荡;RACS 构建安全强化学习三元迭代框架;DACER 嵌入反向扩散模型支持多模态动作生成;BOOM 采用规划自学习驱动机制;NANO 提升复杂系统状态估计能力;MVP 兼具生成式策略表达能力与高时间效率。
展望:迈向泛在具身智能
人工智能时代方兴未艾,信息智能已如火如荼,具身智能正在路上。物理原生智能为从自动驾驶走向机器人、进而迈向泛在具身智能提供了值得探索的技术路径。未来,我们有望在人机交互、蛋白质、基因及量子等领域,见证与人类相提并论的智能成就。

