一句话洞察:从强教师均匀抽取层初始化学生,再联合使用真值流匹配、教师速度模仿和“动作查询→视觉语言键”的中层注意力实现模型蒸馏。
核心问题:核心缺口是计算、部署可扩展性与成本。
4、模型蒸馏成本可接受,并且作者发现小主干从头训练还不如大教师蒸馏
Shallow-π:如何让“让大模型机器人反应更快,同时尽量不变笨”。
核心方法
1、在目标数据上训练完整 π₀ 或 π₀.₅ 教师。2、选择学生深度 Ls∈{9,6,4},保持其余维度不变,并从教师层初始化。3、对每个样本抽取同一 ϵ,τ,同时前向教师和学生。4、计算真值速度损失、教师速度损失,以及中层 action→VL 注意力 KL。5、仿真训练 30K 步、batch 64;真机模型训练 100K 步、batch 128。6、推理时缓存 VL 前缀 KV,只重复运行浅动作头并积分向量场。
实验全景
实验设置:教师—学生比较使用相同相机输入、数据和训练步数。CogVLA、LightVLA、SmolVLA 与本方法的预训练、宽度、动作头、token 数及训练预算未证明完全对齐。不过文章中没有报告具体的优化器与学习率、图像分辨率、扩散步数、精度格式、训练硬件/时长/显存、随机种子、重复次数、统计检验及 H100 计时的 batch、warm-up 和同步方法。

主要结果

实结论是:绝大部分能力来自初始化与真值监督,教师输出有稳定但不大的增益,注意力蒸馏增益更小。在无多种子误差条的情况下,0.3–0.7 pp 未必超过随机波动。中层优于初/末层,但没有精确层索引或更多位置扫描。论文确实报告了两个负结果:激进无训练跳层崩溃,以及全-token 注意力蒸馏崩溃;但没有初始化策略、损失权重、教师质量或同构随机学生消融。
总结
这篇论文架构机制证据为中等偏强;触觉在接触密集任务中的效用证据较强;参数效率证据较强。
本文内容整理自学术论文:《Shallow-π: Knowledge Distillation for Flow-based VLAs》,仅作学术分享使用,版权归原作者及出版方所有。
本文作者和单位来自于三星实验室。
关注【具身智能制造】,每周拆解机器人与 AI 领域顶会,带你紧跟前沿技术~

