大数跨境

生数双线破局背后:朱军团队正在为世界模型立「通用语法」

生数双线破局背后:朱军团队正在为世界模型立「通用语法」 AI科技评论
2026-09-10
5
导读:从李飞飞分类法到朱军GWM,世界模型正在形成大一统终局。
从李飞飞的功能分类到朱军的通用世界模型(GWM),世界模型正迈向大一统终局。

    作者丨齐铖湧

    编辑丨董子博

机器人旋入灯泡的动作看似简单,实则需预判对准角度、阻力反馈及潜在风险。一旦失误,后果不仅是生成失败,更涉及物理损坏甚至安全隐患。这正是世界模型的核心难点。
当前,视频生成、三维重建及机器人策略等领域均广泛使用“世界模型”概念。然而,逼真的像素、可计算的物理状态或单一控制轨迹,并不等同于模型真正理解了世界。关键在于:模型能否在行动前预见后果,并在行动后通过反馈修正判断。
今年 6 月,李飞飞团队发布《A Functional Taxonomy of World Models》,将世界模型分为渲染器(输出像素)、模拟器(输出几何与物理状态)和规划器(输出动作),厘清了不同系统的功能边界。而清华大学朱军团队提出的通用世界模型(GWM)框架,则聚焦于机器如何获得通用智能:通过理解、想象、行动及反馈闭环,实现从过去判断到未来推演,再到路径选择与自我修正的完整认知循环。
两张地图殊途同归:世界模型的价值不在于渲染更逼真的像素,而在于让机器对其改变世界的后果负责。

01


两张地图,同一个终局

李飞飞团队基于经典 POMDP 框架,按“输出内容”将世界模型划分为三类。该分类法强调了模拟器作为渲染与规划桥梁的重要性,指出缺乏精确物理状态模拟的规划只是空谈。这与 World Labs 的 Marble 路线高度契合,即追求高斯泼溅与碰撞网格的几何一致性。
然而,功能分类法仅回答了“能干什么”,未定义“如何干”。针对这一局限,arXiv 上新论文批评其只分类了解码投影,忽视了内部表示。对此,朱军团队提供了系统性答案:早在 2025 年 12 月 Motus 发布时,便提出了连接数字与物理世界的通用世界模型构想,并于 2026 年 8 月在《General World Models from First-Principles》中完善了基于第一性原理的五级进化路线图。
GWM 框架不按输出分类,而是按认知阶段划分三大核心能力:理解(将过去转化为内部状态)、想象(推演可能未来)与行动(选择路径并获取反馈)。这并非否定李飞飞的分类,而是补全了因果闭环视角。
李飞飞描绘的是“物理表象”,朱军聚焦的是“因果闭环”。两者终局判断一致:大一统。李飞飞认为渲染、模拟与规划底层知识边界正在消融;GWM 则强调理解、想象与行动必须内生于同一基座。分歧在于路径:前者侧重物理精确性作为基础,后者侧重因果闭环作为验证,二者互为因果,共同构成完整的世界模型坐标系。

02


从生成模式到世界模型,

模型大一统背后的清华传承

理解 GWM 框架需回溯朱军团队二十年的学术主线:机器如何在不确定环境中形成理解、预测未来并依据反馈行动。作为 ACM、IEEE、AAAI Fellow 及张钹院士弟子,朱军长期深耕概率机器学习与世界智能。
团队早期成果 Analytic-DPM 和 DPM-Solver 解决了扩散模型采样效率瓶颈,嵌入 Stable Diffusion 等主流链路。宋飏(前 OpenAI 战略探索负责人)与宋佳铭(DDIM 提出者)等杰出校友均受训于此。然而,扩散模型仅解决“生成像什么”的视觉合理性问题,未触及“世界为何变化”的因果逻辑。
原 OpenAI 战略探索团队负责人宋飏和 DDIM 之父宋佳铭
从“生成”跨越到“因果”,是从视觉规律走向物理规律的关键。朱军团队选择继续向前,推动模型从“知道杯子落地会碎”进化为“理解接住杯子可改变结果”。生数科技的技术路线因此同步走向视频生成与具身动作:前者提供演化广度,后者在真实反馈中检验理解深度。工具在变,但处理不确定性、生成与因果闭环的内核未改。

03


通用世界模型,首次被清晰定义

生数科技将通用世界模型的进化划分为五个层级,描述了模型承担责任逐级增加的过程:
L1 阶段:学习世界演化。以 Vidu Q3 为代表,核心突破在于从单镜头生成走向声画同出、多镜头叙事与时间一致性,理解时间轴上的因果链。
L2 阶段:与世界交互。2026 年 7 月发布的 Vidu S1 实现了语音实时介入生成,将视频生成从离线输出转变为实时交互系统,维持身份与状态的一致性。
L3 阶段:对行动负责。Motubrain 及 Motus2 将路径推向真机行动。2026 年 4 月发布的 Motubrain 统一了环境理解、状态预测与动作生成,推理速度提升约 10 倍,在 RoboTwin 2.0 基准测试中位居榜首,并已在多种机器人本体上完成验证。
L4 与 L5 阶段涉及长期目标、自主探索及多智能体协同,仍是未来目标。2026 年 9 月上海外滩大会上,生数科技预告了面向灵巧操作的自进化通用世界模型 Motus2。
Motus2 的核心创新在于让同一组共享参数承担策略提出、后果模拟与价值评估三项工作。机器人无需在真机上试错,即可在模型内预演分支并选择最优解,执行后的反馈进一步驱动策略改进,实现真正的“自进化”闭环。

04


从闭环到现实:

通用世界模型的三道工程关

世界模型落地面临三重工程壁垒:
数据金字塔:底座为网络视频常识,塔尖为真实机器人轨迹验证。缺底座则模型泛化能力弱,缺塔尖则无法落地。
架构一致性:MoT 融合多模态的目的在于对同一世界状态的一致理解,避免视觉、语言与动作之间的错位。
算力实时性:Motubrain 的 5Hz 推理频率是机械臂控制的生死线,直接决定响应速度与动作连续性。
补齐这三块拼图后,世界模型将从单一产品演进为驱动数字与物理交互的底层引擎。在数字世界,它将支持游戏、影视及虚拟人等领域的实时交互演化;在物理世界,它将成为机器人理解环境、预测后果并持续修正的基础,助力仓储物流、工业制造及家庭服务场景的智能化升级。

05


从南北坡向 AGI 顶峰攀爬

全球 AGI 竞逐呈现两条清晰路径:北坡以语言模型为代表,积累人类知识符号,擅长理解意图与规划任务;南坡以世界模型为代表,直面动态物理世界,要求机器在行动前预演未来并从反馈中学习。
智谱代表的语言智能与生数代表的世界建模,正如同一座山的南北两坡,互为支撑而非竞争。语言赋予 AI 知识与抽象能力,世界模型赋予 AI 经验与物理实感。唯有两者结合,AGI 才能从“谈论世界”真正走向“进入世界”。
在中国 AGI 版图上,智谱与生数已分别部署登山队,分别从语言与物理两端向通用智能顶峰发起冲击。当机器既能读懂人类指令,又能预见行动后果并在反馈中修正,通用人工智能的曙光终将到来。
【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8946
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读239.2k
粉丝0
内容8.9k