2026 No.14 期
AI Agent 研讨干货「1」:世界模型的定义、路径与商业化
NEWS
本期邀请来自 AI 基础模型、世界模型创业公司、游戏引擎、具身智能及投资机构的多位嘉宾,围绕世界模型的定义、技术路径与商业化机会展开深度讨论。
行业共识逐渐清晰:世界模型不仅是模型能力的升级,更是探索让 AI 理解、预测并作用于世界的新型智能范式。然而,技术路径分化明显——从游戏虚拟世界到自动驾驶与机器人,不同场景对 State(状态)、Action(行动)及数据的定义各异;从视频生成、3D 表征到仿真系统,各类技术路线仍处于探索期。
本文将聚焦核心议题:世界模型的边界何在?不同场景需要怎样的数据与建模方式?在技术未收敛阶段,创业公司的长期壁垒将沉淀于何处?
[ 本期嘉宾 ]
SEAMATE
部分嘉宾因公司保密要求未公开姓名或内容有所删节,感谢所有嘉宾的精彩分享。
- 51Earth.inc|General Manager|杜菲
- Family Office|Investor|Emma ZHU
- Menlo AI|CEO|James Yin
- Talespark|CTO|Rolan
- WorldKey|Co-Founder|Mingfei Bi
- 不鸣科技|Co-Founder|吕鹏
- 嘉程资本|EIR|Jingyu Guo
- 江苏省高投|投资经理|邹佳辰
- 美团|分析师|董嘉璇
- 科技大厂|Researcher|Ori Zhang
Part.01 定义与产品形态
世界模型的第一性定义
董嘉璇|美团
世界模型的核心在于是否刻画了世界 State 的变化。判断标准应关注模型的输入与输出:若模型描述的是 State 的转移过程,则定义为世界模型;若仅处理传统 2D 或 3D 输入输出,则不宜归入此类。关键难点在于 Action 如何推动 State 转移,以及不同场景下对 State 和 Action 定义的差异(如 2D 与 3D 空间的选择、Action 的输入形式)。
数据选择上,基于 2D 视频的 Demo 效果显著,得益于数据量大且易于 Scaling。但在 State 表示上行业存在分歧,尤其是 3D 模型在世界模型中的表征方式(如 Mesh 结构的压缩与选择),导致目前技术路线百花齐放。
Jingyu Guo|嘉程资本
世界模型需对世界状态转移进行建模,不仅要理解当前状态,更要预测行为产生的结果及其对任务目标的贡献。真正的挑战在于:行动究竟如何帮助探索世界。
杜菲|51Earth.inc
世界模型主要分为两类:
- 娱乐方向:与游戏结合紧密,如李飞飞的 Marble 项目。
- Physical AI 方向:应用于自动驾驶、机器人等领域,更关注真实性及对真实世界的反馈。
51World/51Earth 目前在国内主要深耕自动驾驶仿真,下一代方案正与英伟达合作,基于 NuRec 和 Cosmos 模型研发,旨在大幅提升仿真效率。
Rolan|Talespark
世界模型本质是“状态转移模型”(Dynamics Model),即 Given current state and action, what's the next state? 这一概念在强化学习早期便已存在。当前的热度源于大模型提升了建模粒度与准确性,尤其是多模态能力的突破。
应用层面可分为两类关注点:
- 预测下一状态(Predict next state):侧重视频流生成的准确性,如干预信号后的画面变化。
- 寻找精准行动(Find accurate Action):侧重具身智能,如何通过行动影响未来,如 VLA(Vision-Language-Action)及 WAM(World Action Model)。
在游戏领域,我更关注逻辑层的“玩法回应”,而非纯视觉渲染。世界模型是手段而非目的,关键在于明确建模的是逻辑 State 还是视觉 State,以及面对的是真实物理世界还是设计的虚拟世界。
吕鹏|不鸣科技
世界模型需具备生成(Generate)和模拟(Simulate)世界 State 的能力。图形学与游戏引擎研究此问题三十余年,传统引擎依赖人力与代码,而世界模型探索的是自动化对偶问题。
我们不建议单纯依赖视频训练或 DiT 架构,因为低维视觉信息难以反推高维世界信息。应从第一性原理出发,构建包含语义、物理等多维信息的表征方式。下一步核心是利用 Agentic 方式生产高标注、多维度的"World Model ImageNet"数据集,记录世界构建过程而非仅记录结果,以此作为模型训练的基础。
最受关注的主流产品
董嘉璇|美团
投资视角下,相比单一技术路线,更看重团队背景。具备大规模集群训练和模型部署经验的团队更具优势,竞争最终将落脚于 Infra 层面的优化。
杜菲|51Earth.inc
利用世界模型进行仿真已成为主流趋势。通过 VLA 模型与世界模型的相互迭代(左右互搏),可显著提升仿真环境的构建效率,超越传统图形学搭建方式。
Emma ZHU|Family Office
当前世界模型尚处早期(类比 GPT-2 之前),投资关注两个维度:
- 数据:输入输出定义、收集处理方式及未来的 Scaling 路径。
- 场景:文娱或具身智能场景决定了数据来源(线上视频 vs 线下真机/Ego 数据)。
热点驱动因素包括具身智能 VLA 路线的瓶颈突破,以及海外高密度人才团队的涌现。目前重点关注两类公司:一是拥有持续数据积累能力的数据公司(可资本化);二是团队完整、人才密度高、能支撑长期系统工程研发的纯模型公司。
产品形态取舍背后的商业判断
董嘉璇|美团
赛道拥挤,基础模型壁垒集中于数据与 Infra 能力。商业化方面,自动驾驶虽竞争激烈但投入持续,最可能率先落地;机器人想象空间大,但跨本体迁移难,落地场景有限。
Jingyu Guo|嘉程资本
数据是最大挑战。当前模型多为“有限世界模型”,依赖视觉或力学传感,仅能建模特定机械物理场景。未来的世界模型需包含更长跨度、更抽象的层面(如宏观事件对世界的长期影响),这涉及更高维度的建模。
James Yin|Menlo AI
AI 生成 3D 资产在 VR 培训中价值巨大,但核心痛点是“有形状无功能”。生成的物体缺乏真实世界的交互逻辑(如咖啡机按钮无法触发内部水流)。
Rolan|Talespark
动态机械系统(如咖啡机)的模拟远超静态 3D 生成范畴,需依赖高精度物理仿真引擎。现阶段神经网络应按层次、按任务拆分,因同时包含完整 3D 信息与动态系统的公域数据极度匮乏。核心瓶颈仍是数据。
Ori Zhang|科技大厂
传统 3D 正在被重新定义,甚至可以说"3D 不存在了”,因为其本质仍可转化为 Token 序列由语言模型处理。未来路径有二:要么由语言模型接管一切,要么跳出传统 3D 框架直接做视频生成或世界模型。传统物理仿真依赖大量人工设定边界条件,难以 Scale,转向 Video Generation 或 World Model 是更优解。
邹佳辰|江苏省高投
高质量 3D 数据获取极难,当前数据规模仅百万级,远不足以支撑数百亿参数模型,行业仍处“小模型”阶段。此阶段算法创新边际效用大,但长期看,数据与人更为关键。
投资人更看重创始人的三项特质:
- 驾驭资金能力:懂得如何高效配置资源购买数据、开发应用。
- 利益分配机制:能否组织高密度人才团队并共享成果。
- 技术敏锐度与转向能力:能否放下路径依赖,及时捕捉前沿技术(如引入 Sensory Model、使用真机数据)。
项目推荐
来自 Seamate Vibe Launch
05/14 · 硅谷
ActAVA(Kora Healthcare AI Factory)
专注医疗健康行业的 AI Agent 基础设施公司。核心产品 Kora Healthcare AI Factory 是面向医院、保险公司及生命科学企业的 AI Agent 生命周期管理平台,涵盖低代码构建、多 Agent 协同、合规测试(HIPAA)及持续优化。创始团队来自 Salesforce Healthcare 及 CMU 机器学习博士。
Gorest.ai
以 Multi-Agent AI 为核心的游戏开发平台。通过自然语言指令,将策划、程序、美术等环节分解为专业 Agent 协作,实现高复杂度互动世界的无代码创建,定位为 AI Native 游戏开发 OS。

