一句话洞察
VLA模型中90%的LLM层输出高度相似,真正关键的只有开头和结尾层——MoLe-VLA借鉴大脑”浅层脑假说”,让模型动态选择激活哪些层,在砍掉一半计算量的同时,任务成功率反而提升了8%。
VLA模型的“肥胖症”:为什么7B参数模型在RTX4090上只能跑10Hz?
视觉-语言-动作(VLA)模型正在重新定义机器人控制范式。从RT-2到OpenVLA再到CogAct,这些模型将视觉感知、语言理解和动作生成统一在一个端到端的框架中,展现出强大的泛化能力和涌现行为。然而,当研究者试图将这些模型部署到真实机器人上时,一个严峻的现实浮出水面:
一个7B参数的VLA模型在RTX4090上,推理频率只有5-12Hz——而Franka机械臂的控制频率要求是50-1000Hz。
这个数量级的差距意味着,要么你需要价值数十万的顶级GPU集群来驱动一个机械臂,要么你只能接受模型在每次决策前让机器人”等待”数百毫秒。对于需要实时反馈的操作任务(如抓取、装配),这种延迟是不可接受的。
VLA模型的高计算开销来自哪里? 问题出在LLM主干网络。标准的VLA架构(如OpenVLA、CogAct)使用LLaMA-2-7B等多层Transformer作为多模态特征提取器,每次推理都需要串行通过全部24+层。但最新研究揭示了一个惊人的事实:
【对应论文图1(A)】
OpenVLA在RLBench上运行时,相邻LLM层输出之间的余弦相似度超过90%,而首层与末层的特征差异显著。这意味着模型在前向传播中,大量中间层只是在”重复处理”高度相似的信息,没有引入新的语义内容。
这个发现指向一个核心问题:我们是否真的需要每次推理都激活所有LLM层? 如果答案是”不需要”,那么如何在保证性能的前提下,让模型”聪明地”跳过冗余层?
MoLe-VLA:三驾马车解决“层冗余”难题
MoLe-VLA(Mixture-of-Layers Vision-Language-Action)提出了一个创新的解决框架,由三个核心技术模块组成:
模块 |
全称 |
功能定位 |
解决的痛点 |
MoLe |
Mixture-of-Layers |
将每层视为专家,动态选择top-k层激活 |
LLM层冗余计算 |
STAR |
Spatial-Temporal Aware Router |
基于视觉空间特征和文本时序特征做路由决策 |
传统路由无法感知机器人物理环境 |
CogKD |
Cognition self-Knowledge Distillation |
全层教师模型向跳层学生模型蒸馏认知信息 |
跳层导致的语义/认知能力损失 |
【对应论文图2】
MoLe-VLA的整体架构图,展示了STAR路由器位于LLM输入阶段,根据视觉和语言输入动态决定跳过哪些层;CogKD则在训练阶段通过认知token进行自知识蒸馏。
2.1 MoLe:从Mixture-of-Experts到Mixture-of-Layers
传统MoE(Mixture-of-Experts)在水平方向上做稀疏化——在一个Transformer层内维护多个前馈网络(FFN)专家,每次只激活其中少数几个。MoLe则将这一概念垂直扩展:将整个LLM的每一层视为一个独立的”专家”,由路由器决定哪些层被激活、哪些被跳过。
形式上,给定一个K层的MLLM π,MoLe路由器处理输入嵌入
,生成二值门控向量
,其中
。只有top-k个G_k被设为1,对应层被执行:

当G_k = 0时,第k层被完全跳过,输出直接继承前一层的隐藏状态。这种设计避免了传统MoE中token被分配到不同专家导致的感知不一致问题(token-wise inconsistency),因为MoLe是对整个输入特征做 holistic 的层选择。
与Mixture-of-Depth (MoD) 的区别:MoD在同一个层内将不同token分配给不同计算路径(标准块或残差连接),可能导致不同token在不同深度被处理,引发感知层级不一致。MoLe则是对整个层做”全有或全无”的选择,保证了所有token在每一层获得一致的处理深度。
【对应论文图1(C)】
MoLe的工作方式类比大脑的”深度-并行平衡”机制——大脑根据任务需求动态激活不同的皮层-皮层下回路,MoLe则根据输入动态选择最优的前向传播路径。
2.2 STAR:为机器人任务量身定制的空间-时序感知路由器
传统MoE/MoD路由器通常只有一个简单的线性层,这种设计在通用NLP任务中够用,但在机器人操作场景中遇到了根本性局限:机器人输入具有强烈的空间结构(视觉图像)和时序依赖(语言指令中的动作序列描述),简单线性路由无法捕捉这些关键信息。
STAR路由器通过两个并行分支解决这个问题:
空间路由分支:处理视觉特征
,通过两层MLP捕获空间结构信息:

时序路由分支:处理文本特征
,使用Transformer + 平均池化提取时序依赖:

动态温度调制:STAR还引入了一个从文本[CLS]token计算的温度因子α ∈ [0,1],通过sigmoid函数生成,用于调制路由的锐度:

最终的专家门控权重通过Gumbel-Softmax生成,确保可微分选择:
G = τ(α · (S + T), τ = 1.0)
STAR的计算效率:相比标准MoE框架的O(N_e · d) FLOPs,STAR仅需
FLOPs。由于在实际机器人VLA中
,这个额外开销微乎其微。
【对应论文算法1】
MoLe-VLA的完整伪代码,清晰展示了STAR如何在前向传播中动态决定层跳过模式。
2.3 CogKD:用自知识蒸馏弥补”认知损失”
跳过层不可避免地带来信息损失——深层编码的关键语义信息(对下游机器人任务至关重要的部分)可能随着层的跳过而缺失。MoLe-VLA通过认知自知识蒸馏(CogKD)来补偿这一损失。
CogKD的核心设计:
• 教师-学生架构:原始全层模型作为教师,MoLe层跳过模型作为学生。教师通过EMA(指数移动平均)更新:
• 可学习认知token(Cognition Token):在输入层插入一个可学习的嵌入,它整合视觉token和语言指令,生成代表”任务需求理解”的紧凑表示。教师和学生各自有自己的认知token:
。
• Tokens of Interest (ToIs):通过计算认知token与学生token之间的相似度,识别出对任务最关键的token:

使用教师和学生认知token的ToIs交集来确定每个token的蒸馏程度:
• 加权蒸馏损失:只有同时被教师和学生认为重要的token才参与蒸馏:
• Reserve KL损失:通过Reverse KL散度增强分布约束,确保学生的认知分布不会偏离教师太远:

最终的CogKD损失为两者的加权组合:
【对应论文图3】
CogKD的详细示意图,展示了认知token如何整合视觉和语言信息,以及ToIs如何指导自适应蒸馏。
实验验证:仿真与真实世界的双重考验
3.1 RLBench仿真环境:10个多样化桌面操作任务
评估在RLBench仿真环境中进行,涵盖10个具有挑战性的桌面操作任务:
任务类别 |
具体任务 |
技能要求 |
物体放置 |
Put Rubbish in Bin, Sweep to Dustpan |
精确抓取与放置 |
容器操作 |
Close Fridge, Close Box, Close Laptop Lid |
关节物体交互 |
工具使用 |
Take Umbrella out of Stand |
细长物体操作 |
精细操作 |
Phone on Base, Change Clock |
毫米级定位 |
长程任务 |
Take Frame off Hanger, Toilet Seat Down |
多步骤规划 |
【对应论文表1】
MoLe-VLA与现有VLA模型在10个RLBench任务上的详细性能对比。
主实验结果(使用50% LLM层跳过):
方法 |
动作头 |
主干网络 |
平均成功率 |
GFLOPs |
OpenVLA |
MLP |
LLaMA2-7B |
45.4% |
1930.0 |
CogAct |
Diffusion |
LLaMA2-7B |
57.2% |
1935.8 |
RoboMamba |
MLP |
Mamba-2.8B |
43.6% |
826.3 |
Random-skip-CogAct |
MLP |
LLaMA2-7B |
51.2% |
984.3 |
MoD-CogAct |
Diffusion |
LLaMA2-7B |
56.4% |
985.8 |
DeeR-CogAct |
Diffusion |
LLaMA2-7B |
59.2% |
997.4 |
MoLe-OpenVLA (Ours) |
MLP |
LLaMA2-7B |
55.6% |
981.5 |
MoLe-CogAct (Ours) |
Diffusion |
LLaMA2-7B |
60.8% |
985.8 |
关键发现:
• 第一,MoLe-CogAct以60.8%的平均成功率位列第一,在仅使用约一半LLM层的情况下,不仅超越了原始CogAct(57.2%),也超越了所有其他效率基线(DeeR 59.2%、MoD 56.4%)。这表明MoLe的层选择策略比简单的early exit(DeeR)或token级动态分配(MoD)更适合机器人任务。
•第二,Random-skip性能下降明显(51.2%,比CogAct低6%),证明不是任意跳过层都有帮助——关键是需要智能的路由机制来选择保留哪些层。
•第三,MoLe-OpenVLA相比原始OpenVLA提升10.2%,说明动态层激活不仅对扩散动作头有效,对简单的MLP动作头同样能带来显著增益。
3.2 效率分析:5.6倍计算量减少的真实含义
【对应论文图4】
展示了成功率与GFLOPs减少量之间的关系,以及不同层数配置下的推理时间对比。

对应论文表2
详细的推理效率统计。
方法 |
推理时间↓ |
GFLOPs(G)↓ |
平均成功率↑ |
CogAct |
0.434s |
1935.8 |
57.2% |
DeeR |
0.337s |
997.4 |
59.2% |
MoLe |
0.309s |
985.8 |
60.8% |
MoLe实现了:
• 推理时间最短:0.309s/次,比CogAct快29%,比DeeR快8%
• GFLOPs最低:985.8G,仅为CogAct的51%
• 成功率最高:60.8%,同时实现了效率和性能的双赢
更值得注意的是,MoLe在仅使用19% FLOPs的情况下就能达到与全层主干网络相当的成功率,实现2倍推理加速。这意味着在资源极度受限的场景(如边缘设备、嵌入式平台),MoLe提供了前所未有的部署可能性。
3.3 量化部署:INT8精度下的实际机器人部署

【对应论文表3】
在商用RTX 4090D上的量化部署测试。
方法 |
精度 |
推理频率↑ |
GPU显存↓ |
平均成功率↑ |
CogAct |
FP16 |
9.8Hz |
16055MB |
57.2% |
MoLe |
INT8 |
15.7Hz |
8887MB |
58.8% |
MoLe-INT8的实战表现令人印象深刻:
• 推理频率提升60%:从9.8Hz提升到15.7Hz,更接近实时控制需求
• 显存占用减少45%:仅需8887MB(约55%的原始显存),使7B模型可以在消费级GPU上运行
• 性能几乎无损:58.8% vs 57.2%,量化带来的损失被MoLe的动态层选择机制部分补偿
3.4 模型扩展性:从小模型到大模型的一致增益
【对应论文表4】
在不同模型规模上的扩展性测试。
方法 |
CogAct-Small |
CogAct-Base |
CogAct-Large |
CogAct |
47.2% |
57.2% |
70.0% |
MoLe |
49.9%(+2.7%) |
60.8%(+3.6%) |
71.5%(+1.5%) |
MoLe在Small、Base、Large三种规模上一致带来性能提升,证明其路由机制具有良好的扩展性。特别值得注意的是,Base模型(7B)上的增益最大(+3.6%),这正是当前VLA模型最常用的规模。
3.5 真实世界验证:Franka FR3机械臂上的实操测试

【对应论文表6】
在真实世界Franka FR3机器人上的评估结果(使用3D打印UMI夹爪)。
方法 |
拔充电器 |
拉抽屉 |
倒水 |
平均 |
MoLe |
70.0% |
60.0% |
80.0% |
70.0% |
CogAct |
60.0% |
60.0% |
80.0% |
66.7% |
真实世界实验表明,MoLe在三个日常操作任务上均达到或超越了CogAct。特别是在倒水任务中,MoLe达到了80%的成功率——这个任务要求精确的3D位置估计和旋转预测,对模型的空间理解能力提出了极高要求。

【对应论文图5 】
展示了MoLe-VLA在RLBench仿真和真实世界环境中的操作过程与任务完成状态的定性可视化结果。
消融实验:STAR和CogKD各自贡献了多少?
详细的消融实验结果。
实验 |
STAR |
Cognition Token |
CogKD-MSE |
CogKD-KL |
ReserveKL |
平均成功率 |
Ex_0 (CogAct基线) |
✗ |
✗ |
✗ |
✗ |
✗ |
57.2% |
Ex_1-1 |
✓ |
✗ |
✗ |
✗ |
✗ |
56.3% |
Ex_1-2 |
✓ |
✗ |
✓ |
✗ |
✗ |
54.8% |
Ex_2-1 |
✓ |
✓ |
✓ |
✗ |
✗ |
58.3% |
Ex_2-2 |
✓ |
✓ |
✗ |
✓ |
✗ |
57.7% |
Ex_2-3 |
✓ |
✓ |
✗ |
✗ |
✓ |
59.4% |
Ex_2-4 (完整) |
✓ |
✓ |
✓ |
✗ |
✓ |
60.8% |
这组消融实验揭示了几个关键洞察:
• 单独使用STAR反而略微损害性能(Ex_1-1: 56.3% vs 57.2%)。这说明单纯跳过层而不补偿认知损失是有风险的——路由器可能跳过了对任务至关重要的深层语义信息。
• 认知token是关键的”补偿器”。对比Ex_1-1(56.3%,有STAR无cognition token)和Ex_2-1(58.3%,有STAR和cognition token),加入认知token立即带来2%的性能回升。认知token帮助模型在层跳过的情况下仍能保持对任务需求的准确理解。
• Reserve KL损失比标准MSE模仿更有效。Ex_2-3(59.4%,MSE+ReserveKL)比Ex_2-1(58.3%,仅用MSE)高出1.1%,而Ex_2-2(57.7%,KL损失)效果最差。这说明Reverse KL方向(约束学生不偏离教师太远)比正向KL更适合蒸馏场景。
• 完整配置达到最佳(60.8%)。STAR + Cognition Token + MSE模仿 + ReserveKL的组合,相比基线提升了3.6%。
核心启示:动态层激活的范式转移
MoLe-VLA不仅是一个效率优化方法,更代表了一种新的VLA模型设计范式:
• 启示一:LLM在VLA中的”层冗余”远超预期
相邻层90%+的余弦相似度意味着,对于机器人操作这类”物理接地”的任务,LLM的大量中间层确实在做重复计算。这与纯NLP任务形成对比——在复杂推理任务中,每一层可能都在进行不同深度的逻辑推演;但在机器人操作中,视觉-语言融合后的特征表示相对稳定,不需要24+层的深度加工。
• 启示二:路由器设计必须与任务特性匹配
传统MoE的简单线性路由器在机器人任务中表现不佳,因为机器人输入具有独特的空间-时序结构。STAR的成功证明,将视觉的空间信息和语言的时序信息显式编码到路由决策中,是动态层激活在 embodied AI 中发挥作用的必要条件。
• 启示三:“效率-性能”不是零和博弈
MoLe-VLA打破了一个常见假设:加速模型必然牺牲性能。通过智能地保留关键层、跳过冗余层,并用CogKD补偿认知损失,MoLe实现了计算量减少51%的同时,任务成功率反而提升3.6%。这说明冗余层不仅浪费计算,还可能引入噪声——移除非关键计算有时反而让模型更专注于核心任务。
传统方法 |
MoLe-VLA |
差异 |
固定层深,全层激活 |
动态层选择,top-k激活 |
自适应计算深度 |
简单线性路由 |
空间-时序感知路由 |
任务感知的路由决策 |
直接剪枝/量化 |
剪枝+认知蒸馏联合优化 |
性能损失可补偿 |
效率↑→性能↓ |
效率↑→性能↑ |
双赢而非零和 |
局限性与未来方向
尽管MoLe-VLA取得了显著成果,仍有几个值得关注的方向:
• 动态任务的适配性:当前MoLe主要针对相对静态的桌面操作任务设计,对于需要快速反应的动态任务(如抓取运动中的物体),层跳过策略可能需要调整。
• 更细粒度的激活策略:当前MoLe在层级别做”全有或全无”的选择,未来的工作可以探索子层级别的稀疏激活(如只激活FFN而跳过Attention,或反之)。
• 在线自适应路由:当前的路由器在训练后固定,未来可以探索根据实时任务难度动态调整层数的在线自适应机制。
• 认知token的可解释性:认知token在CogKD中扮演关键角色,但其内部表示的语义含义尚不完全清晰,深入分析可能揭示任务理解的神经机制。
本文内容整理自学术论文:《MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation》,仅作学术分享使用,版权归原作者及出版方所有。
• 论文作者:Rongyu Zhang, Menghang Dong, Yuan Zhang, Liang Heng, Xiaowei Chi, Gaole Dai, Li Du, Yuan Du
• 发表单位:南京大学、香港理工大学、北京大学、北京人工智能研究院、香港科技大学
• 论文链接:Project Webpage
关注【具身智能制造】,每周拆解机器人与 AI 领域顶会,带你紧跟前沿技术

