大数跨境

【RSS 2026】X-DiffVLA:分块加噪,循枝寻优

【RSS 2026】X-DiffVLA:分块加噪,循枝寻优 具身智能制造
2026-08-03
4
导读:一句话洞察:不用换Action Head的VLA应该是什么样?
A4纸张海报.png

一句话洞察:VLA模型在下游部署时几乎总要为每种机器人末端执行器单独微调一个 action head,这既浪费算力又切断了不同本体之间的数据复用,本文要做的是一个能同时服务夹爪与灵巧手的统一动作头。

image.png
01

核心问题:换末端就要换模型

1、换本体就要换ActionHead,训练效率差且阻断跨本体数据复用。

2、异构本体联合训练会产生"分布干扰"(夹爪 vs 灵巧手),导致次优。

3、跨本体数据里存在可迁移的隐相关(同底座、同任务→功能相似)。

image.png



















02

X-DiffVLA:为什么它能解决跨本体的问题?



image.png

核心方法

1、构造统一动作空间:按 [base | gripper | dexterous hand] 分段,低 DoF 本体尾部补零。

2、提出假设,即只有末端存在差异。所以一条完整的机械臂数据包括机械臂 + 夹爪 + 灵巧手。

3、将加噪过程,分割为块。作者通过实验得出当块的数量为4的时候效果最好。

4、执行加噪过程。加噪的过程包括:Timestep / Noise Action + 机器人本体信息(机器人自身状态,如关节位置、基座位置等)+ VLM 的视觉感知 + 机器人末端标志 + 分块末端执行器。image.png

实验全景

1、实验设置


RoboCasa Isaac Gym 真机
GR00T 数据集轨迹回放 + motion retargeting 到新末端,经环境反馈与人工筛选 DemoGrasp策略生成专家轨迹 GELLO 遥操作臂 + Manus 手套采集
30 任务 × 50 轨 × 3 末端配置(Table VIII 列出任务名) 10 物体 × 10 轨 5 物体 × 10 轨
RethinkMount / GR1ArmsOnly 底座 × {Panda, Robotiq-85, Inspire} FR3 × {Panda, Inspire, Shadow} FR3 × {Panda, Inspire}
每任务 20 试 ⇒ 每末端 600 试 未明确说明试次(Fig. 3 提到 50 trials) 每任务 20 试 ⇒ 每末端约 100 试

2、实验结果


任务/环境 指标 本方法 最佳基线 绝对增益 相对增益
RoboCasa(3 末端均值) 功率 64.5% π₀.₅ 49.2% +15.3 pp +31.1%
RoboCasa · Panda 成功率 67.2% π₀.₅ 52.3% +14.9 pp +28.5%
RoboCasa · Robotiq-85 成功率 68.0% π₀.₅ 51.1% +16.9 pp +33.1%
RoboCasa · Inspire(灵巧手) 成功率 58.3% π₀.₅ 44.2% +14.1 pp +31.9%
RoboCasa · Mobility Failure #1 失败计数 550 π₀.₅ 784 −234 −29.8%
RoboCasa · Interaction Failure #2 失败计数 89 π₀.₅ 130 −41 −31.5%
Isaac Gym(3 末端均值) 成功率 71.0% π₀.₅ 58.5% +12.5 pp +21.4%
真机(2 末端均值) 成功率 63.5% π₀.₅ 57.0% +6.5 pp +11.4%
image.png


配置 成功率 相对完整模型 相对 w/o ALL 的边际贡献
X-DiffVLA(完整) 64.5% +23.7 pp
w/o SP(去 soft prompt) 62.3% −2.2 pp
w/o MPTD(= EBF only) 54.1% −10.4 pp EBF 单独 +13.3 pp
w/o EBF(= MPTD only) 43.5% −21.0 pp MPTD 单独 +2.7 pp
w/o ALL(朴素扩散头) 40.8% −23.7 pp 基准

03

总结



文章动机明确,方法的核心是以具身形态和功能分区为条件的非各向同性扩散噪声先验。文章讨论了一个可能性,在高维空间中的噪音对已有分布,其实是具有选择性。随后文章更多是通过大量的实验证明这个过程。作为一篇RSS的文章,文章两个致命缺失:没有 specialist上界基线,因此正向跨本体迁移无法证伪;没有未见本体的零样本实验。方法添加后的时延性能损失没有做额外的讨论。

论文出处

本文内容整理自学术论文:《X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models》,仅作学术分享使用,版权归原作者及出版方所有。

• 论文作者:Boyu Li, Chaoyi Xu, Haoqi Yuan, Xinrun Xu, Börje F. Karlsson, Haoran Li, Zongqing Lu, Dongbin Zhao

• 发表单位:中科院自动化所 / BAAI / BeingBeyond / 北京大学










关注【具身智能制造】,每周拆解机器人与 AI 领域顶会,带你紧跟前沿技术~

【声明】内容源于网络
0
0
具身智能制造
深耕尖端工业智能决策系统研发,涵盖高算力云化控制器与工业具身智造底座等产品,致力于实现我国高端制造与智能制造技术的自主可控!诚邀各界英才携手共进,共创行业新未来~
内容 56
粉丝 0
具身智能制造 深耕尖端工业智能决策系统研发,涵盖高算力云化控制器与工业具身智造底座等产品,致力于实现我国高端制造与智能制造技术的自主可控!诚邀各界英才携手共进,共创行业新未来~
总阅读529
粉丝0
内容56