大数跨境

产业资讯丨机器人进入大脑竞赛,蚂蚁灵波占据关键身位

产业资讯丨机器人进入大脑竞赛,蚂蚁灵波占据关键身位 中山市人工智能产业协会
2026-07-13
10

具身智能行业正在经历一个静悄悄却意义深远的转折。

过去两年,如果你问投资人具身智能投什么,答案大概率是本体、灵巧手、关节电机。一台能走能跑的机器人Demo就能撬动数亿融资。但如果你现在去问那些真正把机器人送进工厂、药店、物流仓库的从业者,他们会告诉你一个更残酷的现实:机器人不缺好身体,缺的是一个能真正干活的大脑。

202677—10日,蚂蚁灵波一口气发布六款模型,构成其全栈大脑2.0”体系,并将在一周内密集开源。其中,首个具身原生世界动作模型 LingBot-VA 2.0模型的发布,标志着机器人基础模型正式从基于数字世界模型构建面向物理世界原生设计的关键转变。

这不是一次普通的产品迭代,而是一个清晰的信号:具身智能的竞争焦点,正在从谁的身体更灵活转向谁的大脑更聪明。接下来,行业会进入又一轮竞争:谁将成为具身智能公认的第一大脑

蚂蚁灵波正在用一套完整的全栈技术体系、跨越多家本体厂商的规模化落地,以及一条被行业追随者验证的前瞻路线,为这场行业探索,贡献自己的力量与解法。

一场“大脑竞赛”的悄然开局

20242026上半年,人形机器人赛道空前繁荣。宇树、智元、星尘、乐聚等本体厂商快速崛起;零部件国产替代加速,强化学习驱动的小脑方案让机器人学会跑酷、空翻。

一切看起来欣欣向荣。但真正的问题出在最后一百米

一个在实验室里能精准抓取苹果的机械臂,进了物流仓库面对五花八门的包裹、不同的光照条件、随时变化的传送带速度,往往当场死机。一个在展厅里能和人对话的服务机器人,进了药店面对密密麻麻的药品货架、不标准的药品包装、药剂师随口的指令,立刻手足无措。

这不是硬件的失败,而是软件的断裂。

当前行业的瓶颈非常清晰:机器人在特定场景下被反复训练后能完成特定任务,但换一个场景、换一个本体、甚至换一个光照角度,就需要重新采集数据、重新训练、重新部署。

这背后的根本原因在于——机器人学到的不是物理世界的底层规律,而是特定场景下的统计相关性。解决这个问题的钥匙,不在身体,在大脑。

具身智能的竞争,也正在从本体能力延伸到大脑能力。

谷歌RT-2 2023年推出,结合VLM与动作,按自然语言指令操作,但依赖图文数据,真实场景中面对光照、堆叠等干扰时成功率易衰减,RT-2仍处于实验室迭代阶段,尚未进入规模化商用落地环节,。

再看英伟达。2024年将物理AI列为万亿市场,推出Isaac SimGR00T,但硬件适配和泛化尚处早期。

Physical Intelligence是另一明星,其核心模型π系列旨在共享机器人大脑,但验证仍限于实验室家庭任务,未在复杂商业场景闭环。

截至目前,各家要么有脑无身、有身无脑,要么脑身绑定、无法通用。真正同时具备全栈模型体系、跨本体适配能力、真实商业场景落地案例三要素的玩家,屈指可数。

而就在这个真空地带,蚂蚁灵波正在卡位。

一级市场的资本风向,已经率先对这一产业痛点做出了反应。

根据统计数据,2026年上半年国内具身智能赛道总融资额达437.66亿元,其中以具身大脑为核心业务的大脑派公司融资222.53亿元,占比高达50.8%;而以机器人本体整机为核心的本体派公司同期融资仅56亿元,占比12.8%

从零开始预训练:为什么具身原生是机器人的分水岭?

要理解这次发布的意义,首先需要理解一个概念:具身原生。

什么是具身原生?简单说,就是模型从数据、训练目标到架构设计,全部面向机器人在真实物理世界中完成任务这一原始需求来构建,而不是拿现成的通用模型做嫁接。

当前行业主流是拿来主义”——用面向数字内容创作的视频生成模型做底座,再通过微调适配机器人。但内容创作在意画质和创意,机器人控制在意执行效率和预测合理性,强行微调会带来知识遗忘、泛化性下降。

具身原生则要求模型从一开始就学习动作如何改变世界,而不是画面如何变化。 这是两条路线的本质分野。

LingBot-VA 2.0,正是具身原生理念的首次完整落地。

为什么说它是首次完整落地?因为LingBot-VA 2.0的四大技术支柱,每一项都在为物理世界干活而原生设计:

一是从头预训练。基于自回归视频生成模型从零开始预训练,而不是在现成LLM或通用视频模型上微调迁移。预训练目标直接面向机器人任务:学习动作与环境变化之间的因果关系。这意味着模型的每一层能力都为物理世界任务而生。

二是因果建模。从训练一开始就采用单向自回归架构,确保视觉预测和动作生成严格遵循时间顺序。机器人执行任务是单向的,只能基于过去做下一步;而数字世界模型往往是双向建模,强行微调成单向会破坏泛化能力。因果建模学到的是我的动作会让世界怎么变,而不仅仅是画面通常会怎么变

三是MoE架构。在不牺牲推理效率的前提下扩大模型容量。这项技术来自前一天开源的LingBot-Video——全球首个基于MoE架构、面向具身智能的开源视频生成基础模型。LingBot-VA 2.0给出了单卡150Hz实时推理效率的答卷。

四是专用VAE模块(语义视觉-动作分词器)。 在视觉压缩过程中加入语义与动作信息的对齐,让模型更容易把理解指令转化为完成动作,提升指令跟随与动作精度。

这四项技术合在一起,证明了一件事:LingBot-VA 2.0不是拿通用模型改出来的,是为机器人重新设计出来的。

前序开源的模型同样在佐证具身原生的方向。本周,蚂蚁灵波连续发布六个模型,即全栈大脑2.0”体系,包括空间感知(Vision + Depth 2.0)、世界模型(Video + World 2.0)、灵巧操作(VLA 2.0)、世界动作模型(VA 2.0)。

LingBot-Vision是一个从头预训练的视觉基模,LingBot-Depth 2.0基于它构建——Depth 1.0的关键区别正在于此:有了Vision这个底座,深度感知才真正具备了原生视觉理解能力。

LingBot-Video同样是从头预训练的MoE视频生成模型,其MoE架构和因果预测能力直接支撑了VA 2.0

也就是说,VisionVideo是从头预训练的,VA 2.0也是从头预训练的——这条路正在被系统性地验证。

VLA 2.0承接今天的规模化落地(已在17家厂商20余种构型上验证),VA 2.0定义明天的能力上限。两者共享数据、MoE架构与具身原生的技术思考,构成完整的具身大脑布局。

“具身原生”是分水岭

两条路线的分野,一目了然:

拿来主义:基于LLM或通用视频模型微调学习画面通常会怎么变(相关性)沿用通用架构通用表征间接对齐指令与动作。

具身原生:基于自回归视频生成模型从头预训练学习我的动作会让世界怎么变(因果性)→MoE按需激活专用VAE原生对齐语义与动作。

蚂蚁灵波用LingBot-VA 2.0的四大技术支柱和全栈大脑2.0”的完整体系,把具身原生从理念变成了现实。

随着蚂蚁灵波的重磅发布,具身原生开始成为行业共识,一个真正面向物理世界的通用大脑应具备何种能力,其轮廓正变得越来越清晰。

商业化落地:从适配17家厂商说起

谈论具身智能公司,商业化是绕不开的话题。一个在实验室里惊艳的模型,如果无法在真实场景中稳定运行,在产业眼中就没有意义。

蚂蚁灵波在商业化上采取了一条务实的路径:不和本体厂商竞争,而是成为它们的大脑供应商

一个关键数据是:LingBot-VLA2.0在预训练阶段,就已经完成了对星尘、乐聚、松灵、智元、星海图、宇树等17家厂商20余种机器人构型的适配验证。

这意味着什么?

意味着一个物流公司买了乐聚的机器人,一个药房买了另一个品牌的服务机器人,它们跑的是同一套LingBot大脑。算法迭代一次,所有机器人都能同步受益。本体厂商可以更聚焦于硬件迭代和场景拓展。

这种跨本体的通用性,恰恰是通用大脑定义的核心:不在于它能控制几种机器人,而在于它能否让新构型在极低成本下接入,并保持任务性能。

在工业物流场景,蚂蚁灵波与乐聚合作,将VLA2.0部署到物流分拣产线。传统分拣机器人只能处理固定品类的物件,换品类就需要重新示教编程;而搭载灵波大脑的分拣系统,能够通过少量样本快速适配新品类的抓取与分拣,大幅缩短产线切换周期,降低客户的部署与运维成本。

在零售医药场景,蚂蚁灵波与国大药房合作落地人机协同药房方案。药房场景物件种类繁多、包装形态各异,对机器人的泛化能力要求极高。灵波的具身大脑能够理解药品分拣、整理的指令,灵活处理不同形态的药盒,辅助药师完成重复性工作,提升药房运营效率。

在硬件产品化场景,蚂蚁灵波与奥比中光合作,将自身的视觉感知能力与深度相机硬件结合,推出更适合机器人场景的深度感知产品,实现软硬协同优化,让智能感知能力触达更广泛的硬件终端。

这些落地案例有一个共同特点:都是标准化程度较高、人力替代需求明确的场景,是具身智能最快能跑通商业闭环的领域。从易到难、从标准化到非标准化,蚂蚁灵波的落地路径非常务实。更重要的是,每一个落地场景产生的真实交互数据,都会成为模型迭代的养料。当大多数同行还主要依靠模拟数据训练模型时,蚂蚁灵波已经靠真实场景的数据完成了模型的第一轮闭环进化。

蚂蚁灵波CEO朱兴表示,一方面灵波将持续探索具身智能新上限,另一方面也将加速构建开放的技术生态和场景生态,助力机器人加速走向产业场景。

重新理解蚂蚁灵波:机器人大脑的领跑者

很长一段时间里,外界对蚂蚁灵波的认知都存在偏差。提到它,很多人会下意识地和人形机器人公司对标,追问你们的机器人什么时候量产

但看完这套全栈大脑2.0就会明白,蚂蚁灵波从一开始就选了一条完全不同的路。它不是一家做机器人的公司,而是一家做机器人大脑的公司

在具身智能的产业链上,它的定位非常清晰:聚焦智能层,打造跨本体、跨场景的通用具身大脑,向下赋能硬件本体,向上服务场景客户。这个定位,让它避开了拥挤惨烈的本体赛道,也让它的商业天花板远高于单一的本体厂商。

如果说本体公司的天花板是一年卖出多少台机器人,那么具身大脑公司的天花板,就是全球有多少台机器人跑在你的系统上

纵观当前国内具身智能行业,蚂蚁灵波的差异化优势非常清晰,且难以复制:

首先是路线认知领先。当大多数玩家还在通用模型微调的路线上优化效果时,蚂蚁灵波已经把具身原生做成了完整的技术体系,并且通过一代产品验证了路线的产业价值。

其次是技术体系完整。行业里不乏单点能力突出的团队,但能拿出从感知、预测到操作、顶层动作模型完整全栈,并且实现系统打通、理念统一的公司屈指可数。全栈体系的价值在于,系统级优化的空间远大于单点模块拼接,整体体验会形成质的差异;同时,完整的技术栈也能构建更高的竞争壁垒,后来者很难通过单点突破实现赶超。

第三是产业生态开放。坚持不做本体的中立定位,让蚂蚁灵波能够快速聚拢行业伙伴。短时间内完成20余种构型适配、多个商业场景落地,已经证明了这套模式的可行性。随着生态伙伴越来越多,数据飞轮越转越快,它的领先优势还会持续扩大。

当然,所谓具身智能第一大脑,并非指市场份额或技术参数上的绝对第一,而是当行业开始普遍意识到大脑才是具身智能的核心瓶颈,当市场开始寻找专业的具身大脑解决方案时,蚂蚁灵波有望成为外界第一个想到的代表公司。





栏目推荐




部分信息来源:

财联社

文稿 |蔡展桦

一审 |胡绰妍

终审 |杨逸韵


探索更多

AI门户

视频号

AI营


联系我们



【声明】内容源于网络
0
0
中山市人工智能产业协会
中山市人工智能产业协会深度联动深圳市人工智能产业协会,开展产业交流、科创对接、项目孵化,引进优质产业资源促进中山市人工智能产业发展。
内容 935
粉丝 0
中山市人工智能产业协会 中山市人工智能产业协会深度联动深圳市人工智能产业协会,开展产业交流、科创对接、项目孵化,引进优质产业资源促进中山市人工智能产业发展。
总阅读1.4k
粉丝0
内容935