近年来,Vision-Language-Action(VLA)模型已成为通用机器人操作的重要技术路线。主流做法通常将视觉观测、语言指令和机器人动作联合训练,使模型能根据图像和语言目标直接预测动作。
然而,这一范式下存在一个关键问题:VLA 模型是否真正学会了“语言如何约束动作”?标准 VLA 预训练从一开始就将视觉定位(visual grounding)与动作学习绑定,导致语言 - 动作学习始终被包裹在视觉主导的训练过程中。模型看似在执行语言任务,实则可能更多依赖视觉与动作间的直接关联。
针对此问题,上海交通大学与阿里巴巴联合提出LA4VLA: Learning to Act without Seeing via Language-Action Pretraining。其核心思想并非否定视觉重要性,而是将语言 - 动作监督从视觉主导的训练中显式解耦:在无视觉输入的设置下,让模型学习语言指令如何约束连续动作轨迹,并研究该监督机制的独立效用及其与标准 VLA 预训练的协同效应。
- 论文标题:LA4VLA: Learning to Act without Seeing via Language-Action Pretraining
- 项目主页:https://github.com/MINT-SJTU/LA4VLA
简言之,该研究旨在让机器人掌握更基础的语言 - 动作规律:即使暂时“看不见”,也能依据指令中的动作词、方向词和操作意图,生成正确的运动模式。

01 为什么标准 VLA 训练中的语言监督可能不足
问题的根源在于标准 VLA 训练中,视觉、语言和动作的监督密度不对等。
在数据层面,一条机器人示范通常包含连续的视觉观测、状态和动作轨迹,但仅对应一条高层任务指令(如"clean the table")。执行过程包含靠近、抓取、移动等多个局部阶段,视觉和动作信号逐帧变化,而语言信号全程不变。这意味着模型面对的是大量密集的 visual-action 对,语言与局部动作阶段的对应关系并未被显式标注。
在输入层面,图像被编码为大量 visual tokens,而语言指令占比极小。训练时,模型更容易从视觉输入中寻找动作线索,而非深入学习语言对动作的约束。
因此,VLA 模型在标准输入下虽表现为语言条件化,但其动作预测仍高度依赖 visual-action 关联。一旦视觉输入缺失、替换或与语言冲突,模型极易偏离指令。LA4VLA 指出,若 language-action supervision 始终被视觉信号淹没,模型将依赖视觉捷径,无法形成稳定的语言 - 动作关系。
为此,研究团队将 Language-Action Pretraining 从标准 VLA 中解耦,作为一种独立的预训练信号:让模型显式学习不依赖具体图像和场景布局的 language-action priors,并验证其在提升下游策略、真实机器人操作及抗视觉扰动方面的效果。
02 诊断实验:机器人是在听指令,还是跟着视觉走?
为判断 VLA 策略是跟随语言还是依赖视觉,研究团队设计了诊断实验:保持语言指令不变,改变视觉输入,观察模型预测的动作轨迹是否仍沿指令方向运动。
实验选取方向明确的原子动作指令(如"move upward/downward to approach the target"),构造四种视觉输入设置:

结果显示:在原始配对输入下,模型表现良好;但一旦移除或替换视觉输入,轨迹迅速混乱,方向区分消失。最关键的是在视觉冲突设置下(语言要求朝某方向运动,视觉输入却来自相反方向),预测轨迹明显偏向视觉暗示的方向。这表明模型并非“不确定”,而是在冲突时更倾向于跟随视觉线索。
量化结果进一步证实:标准配对输入下的方向跟随能力,在视觉移除、替换或冲突后显著下降,且在冲突时出现反向偏移。
该实验说明:标准 VLA 训练产生的 instruction following 行为未必稳固建立在 language-action 关系上,模型看似听指令,实则高度依赖配对视觉输入。

03 LA4VLA:将 Language-Action Pretraining 从 VLA 中解耦
基于上述诊断,LA4VLA 提出核心思想:不将语言、视觉和动作一开始就耦合训练,而是先单独抽取 language-action supervision,让模型优先学习语言如何约束动作。
在 LA pretraining 阶段,视觉输入被移除,模型仅根据语言指令和机器人状态预测动作轨迹。这迫使模型关注语言指令本身与连续动作模式的对应关系,而非依赖图像中的目标位置或场景布局。
这种 supervision 并非简单的动作类别标签,而是学习完整的局部动作描述与轨迹的对应关系。例如:
- "Lower the object downward toward the target while holding it"对应持物状态下向目标下放;
- "Transport the object to the right while holding it"对应持物状态下向右水平移动;
- "Open gripper to release and place the object onto the target surface"对应打开夹爪并放置物体。
这些指令包含动作方向、夹爪状态及物理效果,且尽量避免依赖特定物体外观或背景布局,从而形成跨任务、跨场景可复用的 language-action 规律。
LA4VLA 希望模型先习得这些 vision-agnostic 的 priors,再在后续 VLA 训练中结合视觉输入完成具体操作。这不仅是一个新数据集,更是一种新的预训练视角:Language-Action Pretraining 可作为独立、基础且可与标准 VLA 互补的范式。
LA-33K:为独立 Language-Action Supervision 提供数据基础
为实现该范式,研究团队构建了不依赖视觉输入的 Language-Action 数据。LA4VLA 未额外采集数据,而是提出 pipeline 重组已有 VLA demonstrations:将长轨迹切分为短的 atomic action segments,并为每个片段配上对应的低层动作描述。
通过关键帧检测、原子动作约束、VLM 时序分割及人工核验,原始 VLA 数据被转化为 vision-agnostic 的 LA 数据,覆盖 move、grasp、lift、transport 等常见原子操作。最终构建的LA-33K包含 33,116 条经人工核验的 episodes。
LA-33K 的意义不仅在于增加数据量,更在于将原本包裹在 VLA 演示中的 language-action supervision 显式化,使其成为可单独训练、分析及与 VLA 预训练组合的监督信号。

04 实验结果:LA Pretraining 带来了什么?
实验在 MetaWorld 和 LIBERO 两个基准上进行,核心结论如下:
第一,单独 LA pretraining 已有效,且收益覆盖仿真、跨架构和真实机器人

这表明 LA pretraining 并非特定模型或仿真环境的技巧。即使预训练阶段不使用视觉输入,模型学到的 language-action priors 仍可迁移至不同 VLA 架构,显著提升真实机器人中的语言条件操作能力。
第二,LA pretraining 优于 matched VLA pretraining
在相同原子动作片段上,保留视觉输入的 VLA pretraining 效果不如移除视觉输入的 LA pretraining:

这说明移除视觉输入后,模型需更直接地学习 instruction 与 action trajectory 的对应关系。这种集中的 language-action supervision 为后续 VLA 策略提供了更有效的预训练信号。
第三,LA 和 VLA supervision 可以互补
实验对比了无预训练(No)、标准 VLA 预训练(VLA)、纯 LA 预训练(LA)、两阶段结合(LA-VLA)及混合预训练(MixPT)的效果:
- MetaWorld:No 69.73% → LA 83.00% → LA-VLA 86.75% → MixPT 87.53%
- LIBERO:No 92.85% → LA 95.30% → MixPT 95.75% → LA-VLA 96.28%
在真实机器人任务(Press Button、Place Book、Place Drink)中:
- 平均成功率:No 38.3% → VLA 48.3% → LA 81.7% → MixPT 83.3%
- 视觉扰动下成功率:No 27.5% → VLA 42.5% → LA 67.5% → MixPT 70.0%
结论明确:Language-Action Pretraining 是独立有效的预训练信号,优于 matched VLA pretraining,且能与标准 VLA supervision 形成互补。LA 提供不依赖图像的 priors,VLA 提供 visual grounding,二者结合在仿真、真机及抗扰动场景下均带来稳定收益。

05 为什么 LA Pretraining 有效?
除成功率提升外,研究还观察了 LA pretraining 对模型行为和内部表示的影响。

方向跟随结果显示,经 LA pretraining 后,即使无视觉输入,模型仍能根据语言指令预测出清晰分开的相反方向轨迹,动作方向不再轻易被带偏。
t-SNE 可视化显示,标准 VLA-trained policy 的内部表示中不同方向指令混杂,而 LA-pretrained policy 的表示按指令方向形成清晰聚类,相反方向被分至不同区域。
这表明 LA pretraining 不仅提升了成功率,更让模型在动作预测前形成了更清晰的 instruction-conditioned representation,真正学会了“语言如何约束动作”。
06 核心贡献与总结
LA4VLA 的核心贡献不仅是提出新数据集或模型,更是明确拆解出一个关键问题:Language-Action Pretraining 可以从标准 VLA Pretraining 中解耦,成为一种独立、有效且可互补的预训练范式。

研究结果表明,显式的 language-action supervision 是 VLA 学习中值得单独建模和系统研究的关键方向。
07 结语:先学会“听懂动作”,再学会“看见世界”
VLA 模型的目标是结合视觉、语言和动作,让机器人在真实世界执行复杂任务。但若训练初期将三者完全耦合,语言 - 动作关系易被密集的视觉 - 动作信号淹没,导致模型在视觉变化或冲突下偏离指令。
LA4VLA 提供了新思路:先将 Language-Action Pretraining 从 VLA 中解耦,让模型在无视觉输入下学习语言对动作的约束;再将此先验与视觉 grounding 结合,用于下游策略学习。
这不是为了让机器人不看世界,而是为了让其在看见世界之前,先学会理解动作。Learning to Act without Seeing,最终是为了更好地 Seeing and Acting with Language。
论文:LA4VLA: Learning to Act without Seeing via Language-Action Pretraining
机构:上海交通大学 & 阿里巴巴
代码:https://github.com/MINT-SJTU/LA4VLA

