2026 年,具身智能赛道正经历一场悄无声息的“技术路线大分流”。作为机器人的“大脑”,机器人模型的能力边界直接决定了其应用上限。
在英伟达 GTC 大会上,吉利、Momenta、华为等头部玩家公开质疑 VLA(视觉 - 语言 - 动作)模型的局限性,而“世界模型”及 VA 路线则提供了新的解题思路。颇具戏剧性的是,VLA 概念的共同开创者 Generalist AI 团队宣布摒弃标签束缚,认为过度关注工具定义将限制通往物理 AGI 的想象力。
历经数月的路线之争,具身智能行业已步入“落地祛魅”的新阶段。争论声量渐息,模型发布频增,核心较量从理论对错转向实际效能。刚结束的 WAIC 显示,机器人展品已从单纯的动态演示,升级为围绕 3C 电子、汽车制造、仓储物流等真实场景的应用展示。更显著的趋势是,行业主流已从“二选一”转向心照不宣的“路线混搭”。
吵了半年,头部玩家却在悄悄“混搭”
WAIC 释放出的明确信号是:具身厂商展示的模型架构已从去年的单一 VLA 为主,转变为今年的“世界模型+VLA"融合模式。尽管各厂商对世界模型的定位略有差异——或内置用于物理规律学习与决策预演,或作为独立模型协同开发——但融合已成共识。
智平方创始人兼 CEO 郭彦东指出,世界模型并非 VLA 的竞争路线,而是其核心组成部分:“世界模型负责理解世界,VLA 负责作用于世界,两者是天然统一的整体。”
星海图同样坚持融合路线。CEO 高继扬表示,VLA 与世界模型底层逻辑相通,均基于 Transformer 处理交互数据,区别仅在于监督方式与架构细节。该公司采取"VLA+WAM"双技术路线,由 VLA 保障实时操作,WAM 提供前瞻推演,协同实现从“感知 - 决策 - 执行”到“预判 - 优化 - 闭环”的能力跃升。
小鹏汽车通用智能中心负责人刘先明强调,世界模型与第二代 VLA 非替代关系,而是通过不同训练信号共同提升对物理世界的理解。在 CVPR 2026 上,小鹏展示了物理世界基座模型图谱,并指出只有具备基座模型能力的公司,才有望实现 L4 级自动驾驶,并进一步拓展至机器人、飞行汽车等具身载体。
Gartner 研究副总裁高挺预测,未来一两年 VLA 仍将是机器人动作模型的主体,但世界模型将逐步融入,提供更强的物理理解与规划能力。长期来看,两者的深度融合而非简单取代,将是必然趋势。
VLA 的“自救”与升级
尽管泛化能力备受质疑,VLA 模型近期却迎来更新小高潮,且演进方向更加务实。
蚂蚁灵波开源的 LingBot-VLA 2.0 在预训练阶段融入了 6 万小时真实物理数据,覆盖多种机器人构型及人类操作数据。在 GM-100 双臂操作评测中,其任务进度与成功率均领先竞品,且在 RTX 4090 上将推理延迟控制在 130 毫秒以内。这标志着“通用大脑”适配多形态机器人的产品化方向日益清晰。
灵波方面认为,当前 VLA 更像是具身智能的基础底座,需通过后训练工具链和本体适配迁移至具体场景。未来两三年,VLA 将与其他技术路线深度融合,催生出专属于物理世界的具身原生模型。
为解决端侧部署难题,面壁智能发布了参数量仅 1.5B 的 MiniCPM-Robot 系列。该模型在主流评测中跻身第一梯队,单次决策延迟低至 120 毫秒,显著提升了机器人动作流畅度。此外,通过纳入历史观测信息,MiniCPM-RobotManip 在上下文记忆评测中大幅超越竞品,使机器人能够胜任叠衣服、做三明治等长序列任务。
擎仓机器人亦走轻量化路线,其联合上海交大发布的 Evo-Depth 模型参数量仅 0.9B,却将空间感写入 VLA 策略。该模型在仿真与真机测试中表现优异,且仅需约 3.2GB 显存即可实现完全端侧部署与实时控制。
事实证明,VLA 并未“消亡”,反而正朝着更小、更快、更强的方向进化。
加速进化的世界模型
世界模型的发展也已从单纯的“视频生成”和“轨迹预测”迈向“行动一体化”。
大晓机器人在 WAIC 上发布的开悟世界模型 Kairos 3.1 是这一趋势的代表。该模型依托混合 Transformer 架构,将视觉、语言、力触等多维数据压缩进统一隐空间,实现了理解、生成、预测的原生融合。针对物理环境预判失误的风险,Kairos 3.1 搭载了自主反思闭环机制,可在家务等场景中自主拆分步骤、执行任务并在出错后自动重试。其 8B 版本在英伟达 Jetson Thor 平台上的单次推理延迟仅为 125 毫秒。
灵生科技合伙人蒋玉骅则提供了冷静视角:当前具身智能世界模型规模普遍在 10B 以下,尚未出现清晰的 Scaling Law 曲线,整体成熟度相当于大语言模型 GPT-3 之前的阶段。数据和模型的双向驱动将是下半场的关键。
高挺也指出,虽然世界模型发展迅速,但目前更多应用于合成数据生成、仿真评估及辅助规划,直接用于实体机器人控制的案例仍处于早期阶段。
“都是过渡”,具身智能下一站通向哪?
面对快速迭代的技术,行业对“终极答案”的态度愈发谦逊。
灵波方面表示,VLA 擅长模态融合,世界模型擅长状态预测,两者将加速融合形成优势互补的闭环智能能力。其最新发布的 LingBot-VA 2.0 作为行业首个具身原生世界动作模型,从头预训练以适配物理世界的感知与行动需求。随着数据采集成本降低,触觉、力觉及预测能力将进一步汇合,重构机器人大脑架构。
智平方提出了类脑架构演进方向。其 NeuroVLA 系统仿生人类“皮层—小脑—脊髓”三层体系,分别负责深度推理、动作灵巧稳定及本能极速反应,实现在 VLA 和世界模型之上的系统级整合。
Generalist AI 则选择了一条“从零训练”的道路。其新发布的 GEN-1 模型约 99% 参数从零开始训练,不依赖任何现有基础模型,却在成功率、速度及数据效率上实现了跨越式突破。
数据显示,2026 年上半年国内具身智能赛道融资总额同比暴涨约 5 倍,工信部预计今年人形机器人整机产量有望突破 10 万台。然而,与大语言模型清晰的演进路径不同,具身智能尚无被完整验证的技术路线图。
VLA 与世界模型的路线之争仅是具身智能故事的第一章。接下来的分水岭在于让机器人真正动起来并规模化落地。无论采用何种技术标签,可靠性、规模化能力以及在产线与家庭中的实际任务完成度,才是决定路线生死的关键。正如 Generalist AI 团队所言:目标永远比工具的标签更重要。
声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。



