2026 年中,全球 AI 赛道迎来范式级转向,头部玩家集体押注世界模型。
OpenAI 发布 Sora2.0 实现物理级视频生成,xAI 推出 Grok World 可模拟城市级交通与工业产线,李飞飞团队推出的 Atlas 首创空间上下文三维构建能力,字节 Vertex 模型进入最后攻坚阶段。
《2025 胡润中国人工智能企业 50 强》显示,作为世界模型的核心算力底座,AI 芯片相关企业包揽榜单前十中的 7 席,算力硬件类上榜企业达 14 家,较去年大幅增加 9 家。
图源:网络
从拼参数、拼算力的大语言模型军备竞赛,到拼理解、拼推演的世界模型之争,AI 赛道的下半场,已经悄然开场。
01.
从“会说话”到“会推演”
以 GPT-4o 为代表的大语言模型,依托海量文本训练掌握人类语言逻辑,擅长问答与内容生成,本质是对已有知识的复述;世界模型则通过学习真实世界的视频、图像与交互数据掌握物理规律,擅长场景模拟、态势推演与结果预测,本质是对现实世界的仿真还原。
世界模型的概念可追溯至 2018 年 DeepMind 的经典论文,但此后数年间始终局限于实验室前沿探索。
转折点出现在 2024 年,OpenAI 发布初代 Sora,首次让全球直观感受到 AI 对三维空间、物体属性与物理运动的深度理解。它不靠拼接现有视频,而是在内部“渲染”出符合现实逻辑的虚拟世界。
2025 年因此被业内称为“世界模型产业化元年”,谷歌、英伟达及国内厂商密集跟进,赛道快速从学术走向产业。
进入 2026 年,Atlas 带来新一轮技术跃迁,它首创空间上下文机制,将每张输入图像与对应的相机位姿绑定,把不同位置、不同视角的局部信息整合为完整的三维空间,在单一模型内统一了场景生成、三维重建、新视角生成、深度预测等原本分散的任务。
图源:World Labs 官方
官方演示的斯坦福校园案例中,仅需少量游客视角的随手照片,Atlas 就能还原草坪、拱廊与建筑全貌,并生成上帝视角的漫游画面;机器人仿真场景中,仅用两段手机视频各取 24 帧,即可重建大型训练环境,生成机器人沿路径运动时的第一视角画面与深度数据。
OpenAI 首席科学家伊利亚・苏茨克维曾直言:“世界模型是通往通用人工智能的唯一路径。”而在产业端,共识已经形成:大语言模型的边际红利正在见顶,下一个十年的 AI 增长曲线,将由世界模型拉开。
02.
千亿量级押注
经过三年高速发展,纯大语言模型的能力边际效应正在快速递减。训练成本指数级攀升,但用户体验的提升越来越有限;同时,AI 要真正走进实体世界,光靠“会说话”远远不够,必须具备对物理世界的理解与推演能力。
世界模型,正是打破这一天花板的关键。也因此,这场技术竞赛从一开始就带着千亿级的投入量级。
图源:网络
OpenAI 是毫无争议的领跑者,据市场机构测算,其在世界模型方向累计研发投入已超 150 亿美元,Sora 核心团队规模超 800 人。
Sora 2.0 效果图
图源:Open AI
升级后的 Sora2.0 实现了物理动力学级精准,可生成带猫完成花样滑冰三周跳、桨板后空翻等复杂场景,篮球反弹、流体水花等细节的物理误差较初代降低 72%,OpenAI 最新估值也随之突破 2500 亿美元。
马斯克则打出了“数据 + 场景”的组合牌,依托特斯拉每年数十亿公里的自动驾驶数据,以及 Optimus 机器人的实体交互数据,xAI 推出的 Grok World 更偏向实体世界的高精度模拟,可直接用于机器人动作预演与自动驾驶场景推演。典型应用场景包括:模拟城市级早晚高峰交通流,为自动驾驶算法补充长尾极端场景训练;预演机器人在产线上的抓取、装配动作,大幅降低实体调试的时间与成本。对马斯克而言,世界模型正是串联特斯拉、xAI、SpaceX 三大业务的核心技术底座。
图源:网络
在《2026 胡润全球富豪榜》上,马斯克以 1.28 万亿元人民币的财富蝉联全球首富,而世界模型正是他串联特斯拉、xAI、SpaceX 三大业务的核心技术底座。
放眼国内,字节跳动依托抖音与 TikTok 日均超 10 亿次的视频流数据,其自研 EX-4D 框架可将单目视频转换为 4D 多视角场景,技术路线对标谷歌 Genie3 与 Meta V-JEPA 2,核心目标是构建可模拟物理规律的通用数字孪生。目前字节采取前台落地、幕后迭代的策略,由 Seedance 视频模型与豆包承接商业化,世界模型本体持续攻坚,目标 2026 年底达到全球 SOTA 水平。
03.
商业化路径
从技术验证到产业落地,世界模型的商业化路径正逐步清晰,目前主要集中在四大核心领域。
具身机器人被认为是空间最大的落地方向,传统机器人训练依赖真实环境试错,成本高、周期长;引入世界模型后,机器人可以在虚拟仿真环境中完成上万次动作训练,预判碰撞、抓取效果,再迁移到真实场景,效率提升数十倍。
智元机器人参加 2026 胡润品牌嘉年华活动
图源:网络
目前,特斯拉 Optimus、国内的智元机器人、宇树科技等头部企业,均已将世界模型作为运动控制的核心模块。
自动驾驶是第二大核心场景,世界模型可模拟车辆、行人行为轨迹,推演雨雪、夜间等极端工况,提供近乎无限的仿真数据,大幅提升复杂路况下的决策安全性。特斯拉 FSD、百度 Apollo 等头部方案,均已将世界模型纳入核心技术架构。
工业与科研是确定性最强的 B 端市场。从产线仿真、矿山作业模拟到药物分子推演,世界模型可在虚拟空间完成低成本验证,大幅缩短研发周期。目前华为、百度的工业级世界模型已率先在能源、制造行业落地。
内容创意是最先感知变革的领域。以 Sora 为代表的文生视频模型本质是场景化世界模型,随着技术成熟,影视制作、游戏开发、广告营销等行业将率先迎来生产力升级。
但行业挑战同样不容忽视。一是技术与资金门槛极高,世界模型需要海量高质量数据、超大规模算力支撑,还要突破物理精准建模、长时序误差累积等难题,目前全球具备全栈研发能力的企业不超过 10 家。二是规模化商业化路径仍不清晰,不同于大语言模型可通过 API 快速变现,世界模型落地多需深度定制,与场景强绑定,复制难度大、交付周期长,多数企业仍处于试点阶段。
尽管挑战重重,产业方向已十分明确。就像十年前的移动互联网、五年前的大语言模型一样,世界模型正在开启全新的 AI 时代。这场竞赛的核心胜负手,不在于模型规模与算力高低,而在于谁能率先将虚拟世界的模拟能力转化为真实世界的产业价值,抢占下一代 AI 的产业话语权。
本文由胡润百富综合整理
❖ END ❖

