-
世界模型是物理 AI 走向泛化的核心钥匙,是下一代智能的重要技术范式之一。 -
世界模型创业的第一阶段,很像 CV 赛道早期创业投资现象、机制、趋势。 -
当下投资机构对世界模型创业公司,已经从基于学术信用、单点能力进行评估,转向比拼综合工程能力。 -
转折点可能在于世界模型技术路线收敛。应该投资、投入最有可能 Scaling 的技术路线。 -
对创业公司来说,比“谁是技术冠军”、“谁是融资冠军”更重要的,是谁能活到最后。
ㅤ
ㅤ
2026 年 9 月 2 日,李飞飞创办的 World Labs 发布新一代世界模型 Atlas,官方定义为 "全球首个多模态世界模型"。
发布当天,Atlas 迅速刷屏科技圈和创投圈。

ㅤ
2026 年,世界模型正在成为创投圈最炽热的赛道。
ㅤ
World Labs 的热度,正式 2026 年世界模型创业投资热情的缩影。
一笔笔融资密集落地,一家家初创公司从实验室走出,资本、人才、技术在这个夏天以罕见的速度汇聚。
“我,世界模型,打钱”,也成为 2026 年年中的热梗走红。
学术前沿的突破正在以史上最快的速度转化为创业项目。
过去,学术成果要经过技术转移、工程验证和市场教育,才能变成公司。
现在,论文作者直接成为创始人,资本提前把创业公司建成新的前沿实验室。
世界模型的代表性转化周期已经压缩到“同步至两年”,进入了历史上最快的一档。
比如,2024 年,李飞飞公开提出空间智能方向,同年 World Labs 完成 2.3 亿美元融资并展示首个系统;V-JEPA 2 发布约九个月后,杨立昆创立 AMI,种子轮融资即达到 10.3 亿美元。
ㅤ
宇树上市,具身智能创业进入第二赛段 | 锦秋研究 ㅤ
除创业公司外,巨头的入场让赛道更加沸腾。海外巨头已经形成三条主要路线:
ㅤ
中国巨头的布局更集中在开源、3D 世界和具身智能。如:
-
字节跳动:则已组建“多模态交互与世界模型”团队,并从 simulation-ready 的 3D 内容切入;ㅤ -
蚂蚁集团:通过 LingBot-World 强化实时、长时交互和智能体驱动的世界演化,并开启独立融资;ㅤ -
腾讯:连续发布混元世界模型 1.0、1.5 和 2.0,逐步打通 3D 世界生成、重建、实时交互与仿真工具;ㅤ
ㅤ
ㅤ
ㅤ
世界模型百模大战投资困境:越“看”越多,越“投”越多
ㅤ
这是创业者的黄金时刻。
创业公司在数据、算法、机器人的交叉地带开辟新大陆,学术突破为产品化不断输送弹药。
资本在寻找下一个定义物理 AI 时代的公司。它指向的是比 LLM 更大的浪潮——让机器理解物理规律、模拟真实环境,并最终驱动机器人与智能体行动的下一代基础设施。 ㅤ
对投资人而言,创业方向未收敛,创业公司高估值,是当下世界模型投资最核心的结构性难题。
头部创业公司天使轮估值已经飙升至过亿美元。 ㅤ
背景相似、技术路线相似、业务方向相似的创业公司不断新创,同质化严重。
2026 年上半年的世界模型创业与 2015—2016 年的 CV 创业很像。
1、学术信用是主要的投资依据:产品和收入缺席时,资本靠学术背景判断团队。CV 早期看顶会论文、比赛成绩和实验室背景,世界模型更甚——领域横跨 CV、强化学习、机器人、自动驾驶、视频生成等,技术路线未统一,资本更依赖创始人的学术身份和历史战绩。
2、单点能力被迅速抬升为平台叙事:CV 公司从人脸、图像识别切入,融资叙事很快升级为"视觉基础设施""城市大脑""AIoT 平台"。世界模型也在发生同样的跃迁,最终被解读为"大语言模型之后最重要的基座模型"。
3、资本共识早于产品共识:当一个行业被认为可能产生新基础设施,资本竞争会提前发生。投资人买的是三种期权:团队活到技术范式收敛;参与定义行业接口;在下一轮资本共识前占位。
4、最终赛道靠商业场景定义:"世界模型"本身可能不是终局赛道,如同早年的 CV 最终分化为 AI 安防、AI 零售、自动驾驶等。当前主要应用方向为:机器人、自动驾驶、游戏、工业等。
5、世界模型可能比 CV 更难产品化:
-
行动接口碎片化:图片可以统一分辨率,机器人却没有统一的"动作";ㅤ -
必须闭环正确:CV 的一次错误停留在一个样本上,世界模型的错误会被下一步行动放大;ㅤ -
数据闭环昂贵:高价值数据来自真机运行、车辆道路、游戏交互或工业流程,涉及数据权利、隐私和设备协议,客户是否允许数据回流也是问题。ㅤ
6、世界模型还没有自己的"ImageNet":CV 时代有 ImageNet 等共同考题,资本能较低成本地识别科研能力。世界模型并非没有 benchmark,而是不同基准分别测试视频质量、物理规律、驾驶动作、3D 一致性、长时交互或机器人任务,尚未形成行业共同认可的比较秩序。这造成两个后果:公司可以挑最有利的指标展示自己;投资人更容易用团队背景、演示效果和融资规模代替横向比较。
7、更早出现"双重成本曲线":世界模型同时烧模型的钱和交付的钱:一边像基础模型公司一样投入研究人才、训练算力、数据与评测;进入真实客户后,又要像解决方案公司一样承担适配、部署、现场稳定性和售后。如果收入增长不能带来模型复用和交付效率提升,公司会同时承受高研发固定成本和高项目变动成本。
“世界模型是下一代 AI 基础设施”是行业共识,非共识在于技术路线的研判。尤其是对不同技术路线的 Scaling law 突破的预判。
当下,中国几十家世界模型公司的竞争,实际上是多关于“机器应该如何理解和预测世界”的技术路线的验证之路。
世界模型领域已经找到多种“把数据、模型和算力继续做大”的方法。
对于投资人而言,必须投资能 Scaling 的路线。
ㅤ
World Model 可以拆成一条连续的能力链:
当前多数团队在第 B、D 层相对收敛。主要差异是在第 A、C 层。
ㅤ
ㅤ
A|状态表征:模型眼中的世界是什么?
ㅤ
这一层规定了模型的信息预算,也决定了后续预测能力的上限。
目前来看,这与 C 层是不同公司技术的主要差异点。
常见路线包括:
-
视频 VAE latent:保留较多外观和局部运动,适合视觉重建,但可能包含大量无关纹理。ㅤ -
DINO、JEPA 等语义特征:更关注对象、动作和高层语义,但可能丢失精确位置、接触和微小形变。ㅤ -
3D、occupancy、object-centric 表征:更容易表达空间关系和物理约束,但需要更强的先验、传感器或监督。ㅤ -
Visual-action token:从一开始就让表征服务于动作预测和控制。ㅤ

ㅤ
B|动力学预测:模型怎样从现在推演未来?
ㅤ
这一层层研究的是:给定历史状态和候选动作,模型如何预测未来。
这一层技术路线相对收敛。
需要拆开两个维度:
怎样展开时间:
-
逐帧或逐 token 的 AR rollout:AR rollout 灵活,但误差容易逐步累积;ㅤ -
一次预测一段 block/chunk:chunk 预测效率更高,但中途纠错能力可能较弱。ㅤ -
并行预测多个未来时刻;ㅤ -
每执行一步便重新观察和规划。ㅤ
用什么计算机制:Transformer、DiT、扩散、flow-based dynamics、MoE 或记忆模块等。
-
AR 描述序列如何展开;ㅤ -
DiT 是扩散模型的一种骨干网络;ㅤ -
Flow matching 是学习生成路径的训练目标。ㅤ -
一个模型完全可以在时间上采用 AR rollout,同时在每个视频块内部使用 DiT 去噪。ㅤ
ㅤ
C|学习与校验:什么错误会受到惩罚?
ㅤ
这一层定义了模型认为什么是“正确的未来”。这与 A 层是当前差异最大的环节。
需要拆开三个维度:
监督目标:拿什么作为答案。可以是未来 RGB、视频 latent、语义特征和动作,也可以加入深度、光流、法向量、3D 几何、接触、触觉、奖励、任务进度或终止状态。不同监督信号会形成不同的“正确观”:
-
RGB 重建强调画面和运动连续性;ㅤ -
语义对齐强调对象和任务含义;ㅤ -
动作、接触和触觉监督更接近真实控制。ㅤ
目标函数:如何衡量误差,包括像素或 latent 重建、token 交叉熵、JEPA 式表征预测、扩散或 flow matching、forward/inverse dynamics loss,以及奖励或任务成功相关目标。
梯度分配:
-
target encoder 是否冻结或停止梯度;ㅤ -
多种训练目标如何加权;ㅤ -
背景像素是否压过小型操作对象;ㅤ -
接触区域和失败事件是否被重点加权;ㅤ -
长序列中的 credit assignment 如何完成。ㅤ
ㅤ
ㅤ
D|动作耦合:预测怎样改变机器人的行为?
ㅤ
这一层决定世界预测是否真正进入控制闭环,也是区分普通 World Model 与 WAM-style 系统的关键。
目前这一层技术路线相对收敛。 ㅤ
目前主要有四种连接方式:
-
联合生成:同一模型或共享 backbone 同时预测未来状态和 action token,使视觉未来与动作在训练中相互约束。ㅤ -
预测后解码动作:世界模型先生成目标视频、未来 latent 或视觉轨迹,再由 inverse dynamics model 将状态变化翻译为机器人动作。ㅤ -
规划与搜索:世界模型预测多组候选动作的后果,再根据目标、奖励或安全约束选择动作。MPC 会在执行一步后重新观察并规划,V-JEPA 2-AC 属于这一类。ㅤ -
辅助训练或评估:世界模型用于生成训练数据、预测失败、评估策略或提供辅助 loss,但部署时的策略不一定在线预测未来。ㅤ
2025 年 11 月,首期锦秋会,世界模型相关交流讨论
ㅤ
目前没有直接的研究证明世界模型的技术路线何时收敛。
如果对标 LLM 的发展历程来看,现代世界模型竞赛大约始于 2024 年,类似 LLM 在 2017—2018 年进入 Transformer 与通用预训练阶段。
LLM 从 Transformer 到 GPT‑3 用了约三年,从 GPT‑1/BERT 到 GPT‑3 用了约两年。
以此对标,现在还是视频模型的 Pre-GPT3 时代。
ㅤ
ㅤ
ㅤ
随着 World Labs、AMI Labs 在全球进入 10 亿美元融资轮次,流形空间、蚂蚁灵波、逆矩阵等中国头部项目启动十亿元人民币或过亿美元融资区间,世界模型创业正在跨过一个关键分水岭:它不再只是少数明星科学家将学术前沿公司化的早期故事,而开始成为一场由数据、算力、训练系统和测评等共同决定的综合工程能力竞争。
在行业早期,投资机构缺少稳定的产品、收入和统一测评体系,只能用创始人的学术履历、代表性论文、单项 Benchmark 以及演示效果,作为判断技术潜力的代理变量。这些指标仍然重要,但随着融资规模扩大,它们会从“核心定价依据”退化为“进入牌桌的门票”。
这种转变来自世界模型自身的系统复杂性。
一个能够进入真实物理世界的模型,必须同时处理多模态感知、动作干预、状态变化和长期后果。任何一个环节失效,都会导致整个闭环失效:数据缺少动作和结果之间的对应关系,模型就难以学习因果;算力利用效率不足,训练规模就无法扩大;训练体系不稳定,更多数据和算力也无法可靠转化为能力;测评只考察视觉质量而不考察物理正确性,模型就可能“看起来合理、用起来错误”。
因此,这几个环节不是简单相加,而是彼此相乘,最弱的一环决定最终能力上限。
Rhoda 的 Direct Video-Action(DVA)系统提供了一个具体样本。
它不简单拼数据规模和模型大小,而是重新设计数据、训练、推理和验证的分工:用 100 万 + 互联网视频预训练因果视频模型,学习物体运动、空间结构和环境变化;再用少量真机轨迹后训练,适应具体机器人和任务。运行时,模型先预测"未来视频",再由逆动力学模型翻译为可执行动作,每秒多次持续闭环。
数据和算力的工程设计是核心。
数据上,互联网视频量大但无动作标签,真机数据有动作但昂贵——Rhoda 让前者学通用物理先验,后者只学"如何用这副身体实现画面中的动作"。其逆动力学模型仅需约 10 小时同类本体数据,随机运动轨迹也可训练,学会后可在同类本体不同任务间复用。
算力上,它用"上下文摊销"在长视频多位置同时预测未来,提高训练信号密度,推理时缓存复用历史;用"蛙跳推理"在执行上一轮动作时并行计算下一轮,把模型延迟隐藏在动作执行中。比拼的不是卡数,而是能否把同样算力转化为更长上下文、更高训练效率和连续实时控制。
验证也放在真实客户任务中,而非视频质量或单项 benchmark。
汽车零部件拆包:11 小时数据后训练,连续自主运行约 1.5 小时;工业周转箱拆解:17 小时数据,连续运行 160 分钟无人工介入。测试中出现绑带断裂、包装袋撕裂、箱体偏移、首次操作失败等长尾情况,机器人需识别状态变化并修正动作。Rhoda 还利用生成的未来视频,在相同初始条件下比较不同模型和推理参数,使动作决策具有可观察性。
2026 年 8 月 21 日,锦秋小饭桌,星尘智能联合创始人&CFO 方科、流形空间创始人武伟、章鱼动力 CEO 都大龙、章鱼动力联合创始人潘杨家一、第一推力 CEO 宋道灵、第一推力 COO 延新杰、莫刻机器人联合创始人 张泽雨、戴盟机器人 CEO 段江哗、RHOS.ai CEO/ 上交副教授 李永露,以及来自Seed Robotics、Qwen Robotics、银河通用、美团的朋友们一起交流了包括世界模型在内的具身热门话题。
ㅤ
ㅤ
考虑到这是一场持久战,这个赛道的公司首先要回答两个问题:一家世界模型公司究竟需要多少钱;资本是否已经把继续留在牌桌上的权利集中到少数头部公司手中。 ㅤ
做出 Demo、建立公司和活到技术收敛,是三个不同的资金门槛。
如果只看“组建一个世界模型团队”,数千万元就可以起步。
保守估计,如果目标是独立训练模型、形成动作数据与真实场景闭环,并在下一轮融资前完成一次可验证的能力升级,资金门槛会迅速上升到数亿元。 ㅤ
ㅤ
由此看,10亿元更接近一家独立世界模型公司“活过一个完整技术周期”的最低生存门票。
如果技术路线、统一评测和商业付费仍需 4—5 年才能逐渐稳定,公司通常还需要连续两轮以上的融资能力,累计可调用资本可能达到 20 亿元。
如果同时承担基础模型、数据采集、本体和场景落地,资金需求还会更高。
大额融资还包含提前锁定算力、吸引人才、并购、产品化和阻止竞争对手获得资源的战略储备。
ㅤ
这也解释了为什么全球前沿公司的融资规模已经迅速进入 3 亿—10 亿美元区间(虽然,融资额不等于实际成本)。
-
World Labs 在 2024 年融资 2.3 亿美元后,又于 2026 年宣布 10 亿美元新融资;ㅤ -
AMI Labs 启动即融资 10.3 亿美元;ㅤ -
General Intuition 完成 3.2 亿美元 A 轮;ㅤ -
Odyssey 完成 3.1 亿美元 B 轮;ㅤ -
Decart 累计融资超过 4.5 亿美元。ㅤ
ㅤ
ㅤ
ㅤ
当前资本仍在广泛撒网,但资本已经出现头部聚集。
从公司数量看,资本仍在广泛撒网。创业邦睿兽分析的宽口径统计显示,2026 年前 7 个月,中国 64 家“世界模型相关概念”公司中有 58 家获得融资,共发生 105 起融资事件,其中种子、天使和泛 A 轮占 77% 以上。
这说明大量资本先给大量团队一张入场券,避免错过新范式。
但中美从融资金额和连续追投看,资本已经明显进入头部集中。
公开信息显示,World Labs、AMI Labs、Decart、Odyssey 和 General Intuition 五家公司为样本,按已披露累计融资或最新大轮次保守计算,资金下限约 33.4 亿美元;其中 World Labs 与 AMI Labs 两家约占 68%,前三家约占 81%。
中国也出现了同样的加速现象。极佳视界在 2026 年 3 月至 6 月连续完成三轮融资,累计约 35 亿元;流形空间成立一年完成 6 轮融资,Pre-A 累计接近 10 亿元;逆矩阵在首轮融资后不久又完成超 1 亿美元种子++ 轮。
这种集中会形成自我强化:更多资本带来更多算力、数据和人才,更快的模型迭代又带来更高估值和下一轮融资,从而让头部公司拥有更多试错次数。
真正的资本壁垒,不只是能否完成一次大训练,而是一次路线失败后是否还有能力重来。
ㅤ
2025 年 11 月,首期锦秋会,具身相关交流讨论
ㅤ
ㅤ
ㅤ
世界模型的主要商业价值大概率会沉淀在垂直闭环场景中,但在路线分散期,数据、仿真、评测和训练基础设施仍可能形成独立的‘卖铲子’机会。ㅤ
世界模型的主要商业价值,大概率会率先在自动驾驶、机器人、工业和游戏等垂直闭环中兑现。
客户最终购买的是更高的任务成功率、更低的单位结果成本和稳定交付,而不是抽象的模型能力。
但这不意味着所有世界模型公司都会成为垂直公司。平台的机会依然存在。
ㅤ
具身智能正在出现两条越来越清晰的通用平台化路线:
-
Physical Intelligence 代表的"Scaling 路线”——Scaling 能力,让机器人会得越来越多。ㅤ -
Generalist AI 代表的"Learning 路线”——Scaling 学习能力,让机器人面对不会的事情也能迅速学会。ㅤ
ㅤ
ㅤ
Physical Intelligence 的思路非常接近过去几年大语言模型的发展路径:先用足够多样的机器人、任务和环境数据进行 Pretraining,再通过 Post-training、RL、Memory 等手段持续提升模型能力。它相信,Physical Intelligence 同样存在 Scaling Law,随着数据规模、任务复杂度和模型能力持续扩大,一个统一模型最终能够覆盖越来越多机器人、场景和操作任务。因此,PI 想解决的问题是:如何让一个模型“提前学会更多事情”。从 π0 到 π0.5 到 π0.7,再到 RL、Memory 和 Long-horizon,PI 正在不断扩大模型能力边界。
ㅤ
Generalist AI 最近提出的 Physical Prompting 更接近 GPT-3 的 In-context Learning:面对一个从未训练过的新任务,只需要给机器人看几秒钟 demonstration,模型不需要重新训练,就可以直接模仿并执行。Generalist 的设限是:真正的通用机器人,不应该依赖提前收集世界上所有任务的数据,而应该具备快速理解新任务、从少量示范中获得新能力的能力。
但由于通用世界模型需要巨额算力、跨行业数据、开发者生态和持续迭代能力,最后可能只容得下少数平台,大厂很可能胜率更高。
ㅤ
对不少非头部公司而言,现阶段最容易形成收入的是“数据相关服务”。
世界模型距离稳定完成真实任务仍有较长距离,但机器人、自动驾驶和 Physical AI 公司对训练数据的需求已经发生。
海外市场,AI 的 Physical AI Data Engine 正在向 Physical Intelligence、Generalist 等机器人基础模型公司提供真实世界采集、遥操作示范和多模态标注数据。公司披露,2025 年已向机器人和 Physical AI 客户交付超过 15 万小时数据,新增 10 家机器人客户,数据业务实现增长并已盈利。
这意味着,数据相关服务可能成为一些非头部世界模型公司的第一阶段商业模式:先卖数据和仿真能力。
ㅤ
ㅤ
ㅤ
世界模型还处在路线分散期。多技术路线也可能长期并存。
但无论哪条路线胜出,都绕不开几项共同成本:获得高质量动作数据、构造可控环境、运行大规模回放、发现模型失败、完成闭环评测,以及把真实部署结果重新送回训练系统。
因此,相比直接押注某一条尚未收敛的模型路线,帮助所有路线降低这些成本的公司,可能更接近世界模型时代的“卖铲子”生意。
这类机会主要分布在:
-
数据基础设施:采集和对齐状态、动作、结果、力觉与失败数据,解决数据质量、权利和跨本体复用问题;ㅤ -
环境与仿真工具:快速构造极端场景和稀缺失败,让模型在进入真实世界之前完成大量低成本试错;ㅤ -
评测:通过隐藏测试、反事实对照、长时回放和闭环任务,判断模型是否真的学会了动作与后果ㅤ
ㅤ
ㅤ
简单总结,我们认为:
-
世界模型是物理 AI 走向泛化的核心钥匙,是下一代智能的重要技术范式之一。ㅤ -
2026 年上半年的世界模型创业投资,很像 CV 赛道早期创业投资现象、机制、趋势。ㅤ -
但这一次会比 CV 创业更难:没有已经验证的技术路线,没有统一的 ImageNet,模型公司需要同时承担高额研发和可能的交付成本。ㅤ -
当下投资机构对世界模型创业公司,已经从基于学术信用、单点能力进行评估,转向比拼综合工程能力。ㅤ -
转折点可能在于世界模型技术路线收敛。投资人必须投资能 Scaling 的路线。ㅤ -
对创业公司来说,比“谁是技术冠军”、“谁是融资冠军”更重要的,是谁能活到最后。ㅤ 

