一句话洞察:VLA模型在下游部署时几乎总要为每种机器人末端执行器单独微调一个 action head,这既浪费算力又切断了不同本体之间的数据复用,本文要做的是一个能同时服务夹爪与灵巧手的统一动作头。
核心问题:换末端就要换模型
1、换本体就要换ActionHead,训练效率差且阻断跨本体数据复用。
2、异构本体联合训练会产生"分布干扰"(夹爪 vs 灵巧手),导致次优。
3、跨本体数据里存在可迁移的隐相关(同底座、同任务→功能相似)。
X-DiffVLA:为什么它能解决跨本体的问题?

核心方法
1、构造统一动作空间:按 [base | gripper | dexterous hand] 分段,低 DoF 本体尾部补零。
2、提出假设,即只有末端存在差异。所以一条完整的机械臂数据包括机械臂 + 夹爪 + 灵巧手。
3、将加噪过程,分割为块。作者通过实验得出当块的数量为4的时候效果最好。
4、执行加噪过程。加噪的过程包括:Timestep / Noise Action + 机器人本体信息(机器人自身状态,如关节位置、基座位置等)+ VLM 的视觉感知 + 机器人末端标志 + 分块末端执行器。
实验全景
1、实验设置
| RoboCasa | Isaac Gym | 真机 |
|---|---|---|
| GR00T 数据集轨迹回放 + motion retargeting 到新末端,经环境反馈与人工筛选 | DemoGrasp策略生成专家轨迹 | GELLO 遥操作臂 + Manus 手套采集 |
| 30 任务 × 50 轨 × 3 末端配置(Table VIII 列出任务名) | 10 物体 × 10 轨 | 5 物体 × 10 轨 |
| RethinkMount / GR1ArmsOnly 底座 × {Panda, Robotiq-85, Inspire} | FR3 × {Panda, Inspire, Shadow} | FR3 × {Panda, Inspire} |
| 每任务 20 试 ⇒ 每末端 600 试 | 未明确说明试次(Fig. 3 提到 50 trials) | 每任务 20 试 ⇒ 每末端约 100 试 |
2、实验结果
| 任务/环境 | 指标 | 本方法 | 最佳基线 | 绝对增益 | 相对增益 |
|---|---|---|---|---|---|
| RoboCasa(3 末端均值) | 成功率 | 64.5% | π₀.₅ 49.2% | +15.3 pp | +31.1% |
| RoboCasa · Panda | 成功率 | 67.2% | π₀.₅ 52.3% | +14.9 pp | +28.5% |
| RoboCasa · Robotiq-85 | 成功率 | 68.0% | π₀.₅ 51.1% | +16.9 pp | +33.1% |
| RoboCasa · Inspire(灵巧手) | 成功率 | 58.3% | π₀.₅ 44.2% | +14.1 pp | +31.9% |
| RoboCasa · Mobility Failure #1 | 失败计数 | 550 | π₀.₅ 784 | −234 | −29.8% |
| RoboCasa · Interaction Failure #2 | 失败计数 | 89 | π₀.₅ 130 | −41 | −31.5% |
| Isaac Gym(3 末端均值) | 成功率 | 71.0% | π₀.₅ 58.5% | +12.5 pp | +21.4% |
| 真机(2 末端均值) | 成功率 | 63.5% | π₀.₅ 57.0% | +6.5 pp | +11.4% |
| 配置 | 成功率 | 相对完整模型 | 相对 w/o ALL 的边际贡献 |
|---|---|---|---|
| X-DiffVLA(完整) | 64.5% | — | +23.7 pp |
| w/o SP(去 soft prompt) | 62.3% | −2.2 pp | — |
| w/o MPTD(= EBF only) | 54.1% | −10.4 pp | EBF 单独 +13.3 pp |
| w/o EBF(= MPTD only) | 43.5% | −21.0 pp | MPTD 单独 +2.7 pp |
| w/o ALL(朴素扩散头) | 40.8% | −23.7 pp | 基准 |
总结
文章动机明确,方法的核心是以具身形态和功能分区为条件的非各向同性扩散噪声先验。文章讨论了一个可能性,在高维空间中的噪音对已有分布,其实是具有选择性。随后文章更多是通过大量的实验证明这个过程。作为一篇RSS的文章,文章两个致命缺失:没有 specialist上界基线,因此正向跨本体迁移无法证伪;没有未见本体的零样本实验。方法添加后的时延性能损失没有做额外的讨论。
论文出处
本文内容整理自学术论文:《X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models》,仅作学术分享使用,版权归原作者及出版方所有。
• 论文作者:Boyu Li, Chaoyi Xu, Haoqi Yuan, Xinrun Xu, Börje F. Karlsson, Haoran Li, Zongqing Lu, Dongbin Zhao
• 发表单位:中科院自动化所 / BAAI / BeingBeyond / 北京大学
关注【具身智能制造】,每周拆解机器人与 AI 领域顶会,带你紧跟前沿技术~

