
具身智能行业正在经历一个静悄悄却意义深远的转折。
过去两年,如果你问投资人“具身智能投什么”,答案大概率是本体、灵巧手、关节电机。一台能走能跑的机器人Demo就能撬动数亿融资。但如果你现在去问那些真正把机器人送进工厂、药店、物流仓库的从业者,他们会告诉你一个更残酷的现实:机器人不缺好身体,缺的是一个能真正干活的大脑。
2026年7月7日—10日,蚂蚁灵波一口气发布六款模型,构成其“全栈大脑2.0”体系,并将在一周内密集开源。其中,首个具身原生世界动作模型 LingBot-VA 2.0模型的发布,标志着机器人基础模型正式从“基于数字世界模型构建”到“面向物理世界原生设计”的关键转变。
这不是一次普通的产品迭代,而是一个清晰的信号:具身智能的竞争焦点,正在从“谁的身体更灵活”转向“谁的大脑更聪明”。接下来,行业会进入又一轮竞争:谁将成为具身智能公认的“第一大脑”?
蚂蚁灵波正在用一套完整的全栈技术体系、跨越多家本体厂商的规模化落地,以及一条被行业追随者验证的前瞻路线,为这场行业探索,贡献自己的力量与解法。
一场“大脑竞赛”的悄然开局
2024至2026上半年,人形机器人赛道空前繁荣。宇树、智元、星尘、乐聚等本体厂商快速崛起;零部件国产替代加速,强化学习驱动的“小脑”方案让机器人学会跑酷、空翻。
一切看起来欣欣向荣。但真正的问题出在“最后一百米”。
一个在实验室里能精准抓取苹果的机械臂,进了物流仓库面对五花八门的包裹、不同的光照条件、随时变化的传送带速度,往往当场“死机”。一个在展厅里能和人对话的服务机器人,进了药店面对密密麻麻的药品货架、不标准的药品包装、药剂师随口的指令,立刻手足无措。
这不是硬件的失败,而是软件的断裂。
当前行业的瓶颈非常清晰:机器人在特定场景下被反复训练后能完成特定任务,但换一个场景、换一个本体、甚至换一个光照角度,就需要重新采集数据、重新训练、重新部署。
这背后的根本原因在于——机器人学到的不是物理世界的底层规律,而是特定场景下的统计相关性。解决这个问题的钥匙,不在身体,在大脑。
具身智能的竞争,也正在从本体能力延伸到大脑能力。
谷歌RT-2 2023年推出,结合VLM与动作,按自然语言指令操作,但依赖图文数据,真实场景中面对光照、堆叠等干扰时成功率易衰减,RT-2仍处于实验室迭代阶段,尚未进入规模化商用落地环节,。
再看英伟达。2024年将物理AI列为万亿市场,推出Isaac Sim和GR00T,但硬件适配和泛化尚处早期。
Physical Intelligence是另一明星,其核心模型π系列旨在共享机器人大脑,但验证仍限于实验室家庭任务,未在复杂商业场景闭环。
截至目前,各家要么有脑无身、有身无脑,要么脑身绑定、无法通用。真正同时具备“全栈模型体系、跨本体适配能力、真实商业场景落地案例”三要素的玩家,屈指可数。
而就在这个真空地带,蚂蚁灵波正在卡位。
一级市场的资本风向,已经率先对这一产业痛点做出了反应。
根据统计数据,2026年上半年国内具身智能赛道总融资额达437.66亿元,其中以具身大脑为核心业务的“大脑派”公司融资222.53亿元,占比高达50.8%;而以机器人本体整机为核心的“本体派”公司同期融资仅56亿元,占比12.8%。
从零开始预训练:为什么“具身原生”是机器人的分水岭?
要理解这次发布的意义,首先需要理解一个概念:具身原生。
什么是具身原生?简单说,就是模型从数据、训练目标到架构设计,全部面向“机器人在真实物理世界中完成任务”这一原始需求来构建,而不是拿现成的通用模型做嫁接。
当前行业主流是“拿来主义”——用面向数字内容创作的视频生成模型做底座,再通过微调适配机器人。但内容创作在意画质和创意,机器人控制在意执行效率和预测合理性,强行“微调”会带来知识遗忘、泛化性下降。
具身原生则要求模型从一开始就学习“动作如何改变世界”,而不是“画面如何变化”。 这是两条路线的本质分野。
LingBot-VA 2.0,正是“具身原生”理念的首次完整落地。
为什么说它是“首次完整落地”?因为LingBot-VA 2.0的四大技术支柱,每一项都在为“物理世界干活”而原生设计:
一是从头预训练。基于自回归视频生成模型从零开始预训练,而不是在现成LLM或通用视频模型上微调迁移。预训练目标直接面向机器人任务:学习动作与环境变化之间的因果关系。这意味着模型的每一层能力都为物理世界任务而生。
二是因果建模。从训练一开始就采用单向自回归架构,确保视觉预测和动作生成严格遵循时间顺序。机器人执行任务是单向的,只能基于过去做下一步;而数字世界模型往往是双向建模,强行微调成单向会破坏泛化能力。因果建模学到的是“我的动作会让世界怎么变”,而不仅仅是“画面通常会怎么变”。
三是MoE架构。在不牺牲推理效率的前提下扩大模型容量。这项技术来自前一天开源的LingBot-Video——全球首个基于MoE架构、面向具身智能的开源视频生成基础模型。LingBot-VA 2.0给出了单卡150Hz实时推理效率的答卷。
四是专用VAE模块(语义视觉-动作分词器)。 在视觉压缩过程中加入语义与动作信息的对齐,让模型更容易把“理解指令”转化为“完成动作”,提升指令跟随与动作精度。
这四项技术合在一起,证明了一件事:LingBot-VA 2.0不是拿通用模型改出来的,是为机器人重新设计出来的。
前序开源的模型同样在佐证“具身原生”的方向。本周,蚂蚁灵波连续发布六个模型,即“全栈大脑2.0”体系,包括空间感知(Vision + Depth 2.0)、世界模型(Video + World 2.0)、灵巧操作(VLA 2.0)、世界动作模型(VA 2.0)。
LingBot-Vision是一个从头预训练的视觉基模,LingBot-Depth 2.0基于它构建——与Depth 1.0的关键区别正在于此:有了Vision这个底座,深度感知才真正具备了原生视觉理解能力。
LingBot-Video同样是从头预训练的MoE视频生成模型,其MoE架构和因果预测能力直接支撑了VA 2.0。
也就是说,Vision、Video是从头预训练的,VA 2.0也是从头预训练的——这条路正在被系统性地验证。
而VLA 2.0承接今天的规模化落地(已在17家厂商20余种构型上验证),VA 2.0定义明天的能力上限。两者共享数据、MoE架构与具身原生的技术思考,构成完整的具身大脑布局。
“具身原生”是分水岭
两条路线的分野,一目了然:
拿来主义:基于LLM或通用视频模型微调→学习“画面通常会怎么变”(相关性)→沿用通用架构→通用表征间接对齐指令与动作。
具身原生:基于自回归视频生成模型从头预训练→学习“我的动作会让世界怎么变”(因果性)→MoE按需激活→专用VAE原生对齐语义与动作。
蚂蚁灵波用LingBot-VA 2.0的四大技术支柱和“全栈大脑2.0”的完整体系,把“具身原生”从理念变成了现实。
随着蚂蚁灵波的重磅发布,“具身原生”开始成为行业共识,一个真正面向物理世界的“通用大脑”应具备何种能力,其轮廓正变得越来越清晰。
商业化落地:从适配17家厂商说起
谈论具身智能公司,商业化是绕不开的话题。一个在实验室里惊艳的模型,如果无法在真实场景中稳定运行,在产业眼中就没有意义。
蚂蚁灵波在商业化上采取了一条务实的路径:不和本体厂商竞争,而是成为它们的“大脑供应商”。
一个关键数据是:LingBot-VLA2.0在预训练阶段,就已经完成了对星尘、乐聚、松灵、智元、星海图、宇树等17家厂商20余种机器人构型的适配验证。
这意味着什么?
意味着一个物流公司买了乐聚的机器人,一个药房买了另一个品牌的服务机器人,它们跑的是同一套LingBot大脑。算法迭代一次,所有机器人都能同步受益。本体厂商可以更聚焦于硬件迭代和场景拓展。
这种“跨本体”的通用性,恰恰是“通用大脑”定义的核心:不在于它能控制几种机器人,而在于它能否让新构型在极低成本下接入,并保持任务性能。
在工业物流场景,蚂蚁灵波与乐聚合作,将VLA2.0部署到物流分拣产线。传统分拣机器人只能处理固定品类的物件,换品类就需要重新示教编程;而搭载灵波大脑的分拣系统,能够通过少量样本快速适配新品类的抓取与分拣,大幅缩短产线切换周期,降低客户的部署与运维成本。
在零售医药场景,蚂蚁灵波与国大药房合作落地人机协同药房方案。药房场景物件种类繁多、包装形态各异,对机器人的泛化能力要求极高。灵波的具身大脑能够理解药品分拣、整理的指令,灵活处理不同形态的药盒,辅助药师完成重复性工作,提升药房运营效率。
在硬件产品化场景,蚂蚁灵波与奥比中光合作,将自身的视觉感知能力与深度相机硬件结合,推出更适合机器人场景的深度感知产品,实现软硬协同优化,让智能感知能力触达更广泛的硬件终端。
这些落地案例有一个共同特点:都是标准化程度较高、人力替代需求明确的场景,是具身智能最快能跑通商业闭环的领域。从易到难、从标准化到非标准化,蚂蚁灵波的落地路径非常务实。更重要的是,每一个落地场景产生的真实交互数据,都会成为模型迭代的养料。当大多数同行还主要依靠模拟数据训练模型时,蚂蚁灵波已经靠真实场景的数据完成了模型的第一轮闭环进化。
蚂蚁灵波CEO朱兴表示,一方面灵波将持续探索具身智能新上限,另一方面也将加速构建开放的技术生态和场景生态,助力机器人加速走向产业场景。
重新理解蚂蚁灵波:机器人大脑的领跑者
很长一段时间里,外界对蚂蚁灵波的认知都存在偏差。提到它,很多人会下意识地和人形机器人公司对标,追问“你们的机器人什么时候量产”。
但看完这套全栈大脑2.0就会明白,蚂蚁灵波从一开始就选了一条完全不同的路。它不是一家“做机器人的公司”,而是一家“做机器人大脑的公司”。
在具身智能的产业链上,它的定位非常清晰:聚焦智能层,打造跨本体、跨场景的通用具身大脑,向下赋能硬件本体,向上服务场景客户。这个定位,让它避开了拥挤惨烈的本体赛道,也让它的商业天花板远高于单一的本体厂商。
如果说本体公司的天花板是“一年卖出多少台机器人”,那么具身大脑公司的天花板,就是“全球有多少台机器人跑在你的系统上”。
纵观当前国内具身智能行业,蚂蚁灵波的差异化优势非常清晰,且难以复制:
首先是路线认知领先。当大多数玩家还在通用模型微调的路线上优化效果时,蚂蚁灵波已经把“具身原生”做成了完整的技术体系,并且通过一代产品验证了路线的产业价值。
其次是技术体系完整。行业里不乏单点能力突出的团队,但能拿出从感知、预测到操作、顶层动作模型完整全栈,并且实现系统打通、理念统一的公司屈指可数。全栈体系的价值在于,系统级优化的空间远大于单点模块拼接,整体体验会形成质的差异;同时,完整的技术栈也能构建更高的竞争壁垒,后来者很难通过单点突破实现赶超。
第三是产业生态开放。坚持不做本体的中立定位,让蚂蚁灵波能够快速聚拢行业伙伴。短时间内完成20余种构型适配、多个商业场景落地,已经证明了这套模式的可行性。随着生态伙伴越来越多,数据飞轮越转越快,它的领先优势还会持续扩大。
当然,所谓“具身智能第一大脑”,并非指市场份额或技术参数上的绝对第一,而是当行业开始普遍意识到大脑才是具身智能的核心瓶颈,当市场开始寻找专业的具身大脑解决方案时,蚂蚁灵波有望成为外界第一个想到的代表公司。
栏目推荐
部分信息来源:
财联社
文稿 |蔡展桦
一审 |胡绰妍
终审 |杨逸韵
探索更多
AI门户
视频号
AI营
联系我们


