一句话洞察:论文研究如何在双臂灵巧操作中有效整合视觉、本体状态和触觉;通俗地说,它试图让机器人不仅“看见并移动”,还能够在遮挡、插接和按压时“感觉自己是否碰对、压够”。
核心问题:缺数据,缺第一人称的触觉数据
4、从头训练触觉策略成本高,应复用视觉策略
EgoTactile:为什么它能看一眼就能得触觉数据?
核心方法
视觉部分:将相机resize 为正方形256×256,使用Resnet作为视觉编码器。动作部分:设置超参数Action Chunks=32,仅执行16步,Step = 5。
2、第二阶段,冻结主干网络,通过交叉注意力和 rank-32 LoRA 更新 7.97M 参数,使用的触觉Encoder设计是设置MLP 生成 AdaLN 的 scale、shift 和 gate。
实验全景
1、实验设置
DECO-50 由 Unitree H1-2、两只 Inspire RH56DFTP 灵巧手和主动双目相机采集。每只手有 17 个触觉区域、1,062 个 taxel,状态、动作、图像和触觉以 30 Hz 同步记录(频率高于一般的论文)。任务包括抓放、传送带材料分拣、废物处理和双手装配(扩充的工业场景,相比之前的工作更有实际意义)。
论文按场景分别训练四个模型,而不是用一个统一模型覆盖全部任务。图像缩放到 256×256,输入按任务独立标准化;优化器为 AdamW,学习率 10−4,论文配置 batch size 2048。真实机器人评测包含每个物体 10 或 20 次试验,并为任务总计数报告 95% 置信区间。对比测试了ACT / DP,即使是ICML,仍可以与这些基线对比。
消融实验包括三个最有意义的内容。1、耦合 vs 分路触觉。 最终阶段 DECO.cs 为 21/40,DECO.ds 和 DECO.p 均为 29/40,说明触觉的注入方式比“是否加入触觉”本身更关键。2、从头训练 vs 插件适配。 DECO.ds 与 DECO.p 成功率接近,但可训练参数分别为 89.41M 和 7.97M,支持参数效率主张。3、更改特征融合路径。 将本体状态送入交叉注意力、触觉送入 AdaLN 后,最终阶段从 29/40 降到 0/40,并出现控制抖动。这是论文中支持“模态专用路径”的最强证据。
总结
这篇论文架构机制证据为中等偏强;触觉在接触密集任务中的效用证据较强;参数效率证据较强。
本文内容整理自学术论文:《Decoupled Multimodal Diffusion Transformer for Bimanual Dexterous Manipulation with a Plugin Tactile Adapter》,仅作学术分享使用,版权归原作者及出版方所有。
主要由北京智源人工智能研究院(BAAI)牵头,联合 TUM、清华、南京大学、中科院大学及 XYZ Embodied AI,Xukun Li / Yu Sun 共同一作,Zhenshan Bing / Xinlong Wang / Zhenguo Sun 通讯。
关注【具身智能制造】,每周拆解机器人与 AI 领域顶会,带你紧跟前沿技术~

