大数跨境

【Anole VLA】0.47B 参数的小模型,凭什么在真实机器人上打赢3B参数的π0.5?

【Anole VLA】0.47B 参数的小模型,凭什么在真实机器人上打赢3B参数的π0.5? 具身智能制造
2026-07-23
6
导读:一句话洞察:扔掉Transformer,换上Mamba——AnoleVLA用不到π0.5六分之一的参数,在真实机器人任务上成功率高出21个百分点,推理速度快3倍。
A4纸张海报.png



一句话洞察:扔掉Transformer,换上Mamba——AnoleVLA用不到π0.5六分之一的参数,在真实机器人任务上成功率高出21个百分点,推理速度快3倍。

image.png

01

核心问题:VLA模型为什么又慢又重?

当前主流VLA(OpenVLA、π0等)都基于Transformer,而自注意力机制的计算复杂度随序列长度二次增长。当视觉token增加或引入时序上下文时,推理延迟暴涨,内存吃紧——这直接导致7B参数的OpenVLA在消费级GPU上几乎无法实时运行。

image.png

对应论文图1:AnoleVLA与π0.5的对比概览。左图展示深度SSM主干处理语言指令和机器人观察生成轨迹,采用两阶段训练策略;右图物理实验结果显示,AnoleVLA在推理速度和平均成功率上均优于π0.5。



















02

AnoleVLA的三板斧

AnoleVLA的三板斧

image.png

image.png

对应论文图3:AnoleVLA架构图。多模态token(本体感受、状态差分、视觉、语言)拼接后送入Mamba主干,最终token预测H步动作块。两阶段训练分别监督速度和其时序差分。


03

关键数字


CLASS支持两种评估模式:

image.png

image.png

对应论文图4:定性结果对比。(a) AnoleVLA成功抓取圆盘并放置到架子上,基线接近圆盘但未能抓取;(b) AnoleVLA成功抓取锤子敲击螺丝,基线虽然抓到锤子但挥动轨迹错误。




04

真实世界验证:HSR机器人五项日常操作

image.png

对应论文图5:实验平台——丰田HSR机器人(11自由度)和日常YCB物体。

image.png

对应论文图6:成功执行示例——(a)“打开抽屉” (b)“把柠檬放进杯子” (c)“把苹果从托盘里拿出来”。

image.png

核心发现:在”打开抽屉”这种需要精确力控制和流畅轨迹的接触丰富任务上,AnoleVLA(75%)大幅领先SmolVLA(55%)——这正是加速度损失带来的平滑性优势。


05

核心启示:为什么Mamba比Transformer更适合VLA?

根本原因在于机器人的感知特性机器人需要增量式地整合视觉观察来确定动作——先感知本体状态,再融合视觉和语言信息。Mamba的因果递归状态更新天然契合这种”持续过滤、逐步决策”的物理过程,而Transformer的全局注意力则像是在每一步都重新”看一遍整个视频”。

本文内容整理自学术论文:《AnoleVLA: Lightweight Vision-Language-Action Model with Deep State Space Models for Efficient Robotic Manipulation》,仅作学术分享使用,版权归原作者及出版方所有。

 论文作者:Yusuke Takagi, Motonari Kambara, Daichi Yashima, Koki Seno, Kento Tokura, Komei Sugiura

 发表单位:庆应义塾大学(Keio University)

 论文链接:https://anolevla-8z7l8.kinsta.page/

关注【具身智能制造】,每周拆解机器人与 AI 领域顶会,带你紧跟前沿技术~

【声明】内容源于网络
0
0
具身智能制造
深耕尖端工业智能决策系统研发,涵盖高算力云化控制器与工业具身智造底座等产品,致力于实现我国高端制造与智能制造技术的自主可控!诚邀各界英才携手共进,共创行业新未来~
内容 52
粉丝 0
具身智能制造 深耕尖端工业智能决策系统研发,涵盖高算力云化控制器与工业具身智造底座等产品,致力于实现我国高端制造与智能制造技术的自主可控!诚邀各界英才携手共进,共创行业新未来~
总阅读359
粉丝0
内容52