大数跨境

【Shallow-π】打不过就加入,如何高效蒸馏VLAs?

【Shallow-π】打不过就加入,如何高效蒸馏VLAs? 具身智能制造
2026-08-14
4
导读:一句话洞察:从强教师均匀抽取层初始化学生,再联合使用真值流匹配、教师速度模仿和“动作查询→视觉语言键”的中层注意力实现模型蒸馏。
A4纸张海报.png

一句话洞察:从强教师均匀抽取层初始化学生,再联合使用真值流匹配、教师速度模仿和“动作查询→视觉语言键”的中层注意力实现模型蒸馏。

01

核心问题:核心缺口是计算、部署可扩展性与成本

1、减层比减视觉 token 更直接降低延迟
2、相邻层相似度不能代表功能重要性
3、边缘延迟会造成陈旧观测与开环失败

4、模型蒸馏成本可接受,并且作者发现小主干从头训练还不如大教师蒸馏



















02

Shallow-π:如何让“让大模型机器人反应更快,同时尽量不变笨”。

核心方法

先训练完整 18 层教师,再从教师层初始化固定深度学生;学生保持原宽度、token 化和动作生成形式,只减少 VLM 与动作头的层数。训练时既拟合真实动作的流速度,也模仿教师输出,并在中间层对齐真正影响动作生成的 action→VL 注意力。

1、在目标数据上训练完整 π₀ 或 π₀.₅ 教师。2、选择学生深度 Ls∈{9,6,4},保持其余维度不变,并从教师层初始化。3、对每个样本抽取同一 ϵ,τ,同时前向教师和学生。4、计算真值速度损失、教师速度损失,以及中层 action→VL 注意力 KL。5、仿真训练 30K 步、batch 64;真机模型训练 100K 步、batch 128。6、推理时缓存 VL 前缀 KV,只重复运行浅动作头并积分向量场。

实验全景

实验设置:教师—学生比较使用相同相机输入、数据和训练步数。CogVLA、LightVLA、SmolVLA 与本方法的预训练、宽度、动作头、token 数及训练预算未证明完全对齐。不过文章中没有报告具体的优化器与学习率、图像分辨率、扩散步数、精度格式、训练硬件/时长/显存、随机种子、重复次数、统计检验及 H100 计时的 batch、warm-up 和同步方法。

主要结果

实结论是:绝大部分能力来自初始化与真值监督,教师输出有稳定但不大的增益,注意力蒸馏增益更小。在无多种子误差条的情况下,0.3–0.7 pp 未必超过随机波动。中层优于初/末层,但没有精确层索引或更多位置扫描。论文确实报告了两个负结果:激进无训练跳层崩溃,以及全-token 注意力蒸馏崩溃;但没有初始化策略、损失权重、教师质量或同构随机学生消融。


03

总结

这篇论文架构机制证据为中等偏强;触觉在接触密集任务中的效用证据较强;参数效率证据较强。

本文内容整理自学术论文:《Shallow-π: Knowledge Distillation for Flow-based VLAs》,仅作学术分享使用,版权归原作者及出版方所有。

本文作者和单位来自于三星实验室。










关注【具身智能制造】,每周拆解机器人与 AI 领域顶会,带你紧跟前沿技术~

【声明】内容源于网络
0
0
具身智能制造
深耕尖端工业智能决策系统研发,涵盖高算力云化控制器与工业具身智造底座等产品,致力于实现我国高端制造与智能制造技术的自主可控!诚邀各界英才携手共进,共创行业新未来~
内容 56
粉丝 0
具身智能制造 深耕尖端工业智能决策系统研发,涵盖高算力云化控制器与工业具身智造底座等产品,致力于实现我国高端制造与智能制造技术的自主可控!诚邀各界英才携手共进,共创行业新未来~
总阅读544
粉丝0
内容56