一句话洞察
灵巧手是机器人走向日常生活的必经之路——拧瓶盖、按喷雾器、剪袋子、用鼠标,这些对人类来说 trivial 的动作,对机器人却是地狱级难度。核心瓶颈不在策略,而在数据:每种灵巧手形态各异(6到24自由度),高质量遥操作数据稀缺且昂贵。清华团队提出的 UniDex 给出了一条新路:从人类自拍视频中「提炼」机器人可执行轨迹,构建覆盖8种灵巧手的50K轨迹预训练数据集,配合功能对齐的统一动作空间(FAAS)和3D VLA策略,在5个真实世界工具使用任务上达到81%平均进度,并且能零样本迁移到从未训练过的机械手上。
灵巧手操作的三大困境
【图1|UniDex概览】
展示了UniDex的三个核心组件:UniDex-Dataset(从人类视频构建的大规模预训练数据集)、UniDex-VLA(3D VLA策略)和UniDex-Cap(便携式人机数据采集系统)。图中还展示了不同灵巧手在真实世界工具使用任务上的执行效果。
在深入UniDex之前,让我们先看清楚这个领域面临的结构性挑战:
困境 |
具体表现 |
后果 |
数据稀缺 |
灵巧手遥操作数据收集慢、成本高、规模小 |
预训练不充分,策略泛化差 |
本体异构 |
8种主流灵巧手,自由度6-24不等,运动学结构千差万别 |
数据无法共享,每种手都要重新训练 |
控制高维 |
双臂+多指手,动作空间维度爆炸 |
学习难度大,收敛慢,抖动明显 |
现有方法大多针对特定手部设计,或者依赖昂贵的仿真到真实迁移流程。
UniDex的破局思路是:利用人类视频中蕴含的丰富操作先验,通过精心设计的转换管道,将其转化为机器人可执行的、跨手部共享的训练数据。核心组件1:UniDex-Dataset——从人类自拍到机器人轨迹
【图3|UniDex-Dataset可视化】
数据来源与规模
展示了数据集的词汇云和示例帧,涵盖使用手机、打开牛奶盒、炒菜铲翻、搬椅子、解魔方等多样化日常操作。颜色编码表示不同的灵巧手平台。
UniDex-Dataset基于四个公开的第一人称RGB-D人类操作数据集构建:
• H2O:双手操作物体
• HOI4D:4D人类-物体交互
• HOT3D:第一人称多视角手部追踪
• TACO:双手工具-动作-物体理解
最终产出:
• 9M对 图像-点云-动作帧(30fps)
• 50K+轨迹
• 覆盖8种灵巧手平台:Inspire(6DoF)、Leap、Shadow、Allegro、Ability、Oymotion、Xhand、Wuji(20DoF)
• 主动自由度范围:6到24
【表1|与现有灵巧手数据集对比】
数据集 |
轨迹数 |
手部数量 |
语言标注 |
多样化场景 |
RGB |
深度 |
点云 |
ActionNet |
30K |
2 |
✓ |
✗ |
✓ |
✓ |
✗ |
RoboMind |
19K |
1 |
✓ |
✗ |
✓ |
✓ |
✗ |
RealDex |
2K |
2 |
✓ |
✗ |
✓ |
✓ |
✓ |
UniDex-Dataset |
52K |
8 |
✓ |
✓ |
✓ |
✓ |
✓ |
UniDex-Dataset在轨迹总量、手部多样性、感知模态覆盖三个维度上均领先现有数据集。
人类到机器人的转换管道
这是UniDex-Dataset的技术核心。转换需要跨越两大鸿沟:
运动学鸿沟(Kinematic Gap)
人类手部与机器人灵巧手的骨骼结构、关节数量、运动范围完全不同。UniDex采用两阶段人在回路重定向:
• 自动阶段:给定初始偏移
,使用PyBullet的多末端执行器IK求解器,最小化指尖误差
• 交互阶段:轻量级GUI暴露
的6个自由度(3平移+3旋转),用户通过滑块微调,每次调整后重新求解IK。通常几次手动调整即可收敛。
【图2|人类到机器人转换管道】
展示了从原始场景点云
• 到分割人手
• 到移除人手
• 到附着重定向机器人手
• 的完整流程。图中还对比了有无交互调整的效果。
关键设计:对于含 mimic joint 的手部(如Inspire、Oymotion、Agility),在求解主IK后迭代校正从属关节:
视觉鸿沟(Visual Gap)
• 使用 WiLoR + SAM2 分割并移除人类手部点云
• 将重定向后的机器人手网格渲染到场景中
• 通过针孔相机模型将融合点云反投影回RGB-D帧
• 人手被遮蔽,减少运动学和视觉差异
核心组件二:FAAS——功能对齐统一动作空间
为什么需要统一动作空间?
8种灵巧手,URDF各异:关节数量不同、耦合关系不同、布局不同。如果每种手用自己的关节空间,数据无法共享,预训练的意义大打折扣
【图4|FAAS示意图】
展示了Oymotion(11)、Allegro(16)、Inspire(12)、Wuji(20)四种手的拇指和无名指关节映射。颜色表示独立关节,曲线表示旋转方向,虚线表示旋转轴。索引{0,1,3,5,6}在所有四只手上对齐,因为对应关节功能相似。
FAAS的设计原理
FAAS(Function-Actuator-Aligned Space)的核心思想:按功能分组,而非按物理关节分组。
虽然不同手部的连杆长度、耦合关系、布局千差万别,但它们都实现了同一套功能原语:
• 拇指-食指捏合
• 手指蜷曲握把手
• 侧向外展/内收稳定
FAAS是一个82维向量:
• 前18维:双腕姿态(每腕9维:6维连续旋转 + 3维平移)
• 后64维:双手关节指令(每手32槽)
• 21个基础执行器槽:跨所有手部共享
• 剩余槽:手部特定自由度(如Shadow手的额外腕关节)和未来扩展

【附录图15|FAAS关节映射详图】
展示了8种手部(Ability, Allegro, Inspire, Leap, Oymotion, Shadow, Wuji, Xhand)的完整关节映射关系。
FAAS的价值:提供了一个以功能为中心的控制接口,而非URDF特定的关节空间。预训练数据跨越多种手部但共享同一动作表示,使跨手部技能迁移成为可能。核心组件三:UniDex-VLA——3D视觉-语言-动作策略
架构设计
【图5|UniDex-VLA架构】
展示了模型在时间t消耗单视角彩色点云
、语言指令
和本体感知状态
,预测
步动作块
,以FAAS表示。Uni3D编码点云,特征与文本和本体感知在主干中融合,解码为FAAS动作。
观测输入:
• 单视角彩色点云
(从RGB-D生成,裁剪并下采样)
• 自然语言指令
• 本体感知状态 
视觉编码器:Uni3D(替换PaliGemma中的SigLIP 2D编码器)
• 标准ViT设计,从2D预训练ViT初始化 - 将点云特征与图像
•文本对齐特征对齐
策略训练:条件流匹配目标
• 线性高斯概率路径:
• 前向Euler积分生成去噪动作块(步长0.1)
训练流程
预训练阶段:
• 8张NVIDIA H800 GPU,总batch size 128
• 3个epoch(~30K步),约24小时
• AdamW优化器,余弦学习率调度,初始lr=1e-4
后训练阶段:
• 2张H800 GPU per task,batch size 8
• 普通数据:50个epoch(~3K步),约4小时
• DemoGen增强数据:2个epoch(~1.8K步),约2.5小时
• 初始lr=2.5e-5
实验结果:真实世界工具使用任务全面领先
5个任务设置

【图7|真实世界基准任务】
展示了5个具有挑战性的工具使用任务的关键阶段:
任务 |
手部 |
子任务分解 |
Make Coffee |
Inspire |
接近水壶→抓取→移到滴滤器→倒水 |
Sweep Objects |
Inspire |
抓取扫帚→移到物体→扫入簸箕 |
Water Flowers |
Wuji |
抓取喷雾瓶→举起→拇指按压喷水 |
Cut Bags |
Wuji |
三指插入剪刀→握持→张开→剪袋 |
Use Mouse |
Wuji |
放置手指→拖动文件→移入USB文件夹→点击 |
硬件:7-DoF Franka机械臂 + Inspire Hand(6 active DoF) / Wuji Hand(20 active DoF) + Intel RealSense L515
主实验结果:81%平均任务进度
【图11|5个任务平均任务进度对比】
方法 |
Make Coffee |
Sweep |
Water Flowers |
Cut Bags |
Use Mouse |
平均 |
DP |
60.0% |
50.0% |
32.5% |
12.5% |
20.0% |
29.0% |
DP3 |
55.0% |
50.0% |
37.5% |
15.0% |
17.5% |
35.0% |
π₀ |
60.0% |
50.0% |
40.0% |
20.0% |
20.0% |
38.0% |
UniDex-VLA(NoPretrain) |
55.0% |
50.0% |
32.5% |
12.5% |
12.5% |
32.5% |
UniDex-VLA |
87.5% |
82.5% |
85.0% |
90.0% |
60.0% |
81.0% |
核心发现:
• UniDex-VLA平均81%,比最佳基线π₀(38%)高出43个百分点
• Cut Bags最难:DP仅12.5%,UniDex-VLA达90%——灵巧的三指剪刀操作对2D策略几乎不可能
• Use Mouse最具挑战性:即使UniDex-VLA也仅60%——精细的手指协调和点击时机要求高
• 预训练的价值:UniDex-VLA(NoPretrain)仅32.5%,与预训练版本差距48.5pp,证明UniDex-Dataset的大规模预训练至关重要
最终成功率(而非平均进度):
• UniDex-VLA:76.0%
• π₀:35.0%
• DP:22.0%
空间泛化:3D感知的天然优势
【图8|空间泛化实验】
展示了Make Coffee任务中,将水壶和滴滤器沿桌面x/y轴平移到训练分布外的位置。红色和绿色圆圈分别表示水壶和滴滤器的训练放置范围。
UniDex-VLA利用3D点云输入,天然支持几何编辑式数据增强:
• 分割水壶和滴滤器的点云
• 沿桌面平移到OOD位置
• 用TAMP对齐机器人状态到新场景
• 结合DemoGen自动化管道
结果:在整个工作空间内实现高成功率,而2D基线在新位置显著退化。
物体泛化: unseen 物体也能操作

【图9|物体泛化实验】
展示了将黑色水壶替换为更小的紫色水壶(颜色、尺寸、功能部件均不同)。
UniDex-VLA在 unseen 物体上保持强性能,表明其学习到了可泛化的工具理解能力——不是死记特定物体的外观,而是理解了「水壶」的功能和交互方式。
手部泛化(零样本技能迁移):预训练+FAAS的价值证明

【图10|手部泛化实验】
将在Inspire Hand上训练的策略直接部署到Wuji和Oymotion手上,零样本测试。
手部 |
主动DoF |
运动学 |
π₀ |
UniDex-VLA(NoPretrain) |
UniDex-VLA |
Wuji |
20 |
完全不同 |
0% |
0% |
40% |
Oymotion |
6 |
差异大 |
10% |
5% |
60% |
• Wuji(20 DoF):UniDex-VLA 40%,基线全部0%——基线完全无法处理如此不同的运动学
• Oymotion(6 DoF):UniDex-VLA 60%,π₀仅10%——FAAS使跨手迁移成为可能
• NoPretrain版本几乎为0%:证明大规模跨手部预训练是零样本迁移的前提
核心组件四:UniDex-Cap——人机数据协同训练
系统设计
【图12|UniDex-Cap系统】
展示了(a)硬件组件、(b)数据记录视角、(c)捕获的人类数据、(d)转换后的机器人可执行轨迹。
UniDex-Cap是一个便携式数据采集系统:
• Apple Vision Pro:手部/头部姿态估计
• Intel RealSense L515:高质量RGB-D
• 定制3D打印支架:刚性固定两个传感器的相对姿态
• 视角变换:对齐人类和机器人视角
• 下采样:匹配典型遥操作速度
人机协同训练的定量研究

【图13|人机协同训练结果】
展示了Make Coffee任务上,不同数量的人类演示(h)和机器人演示(r)组合的平均任务进度。
三大发现:
• 人类数据有帮助,但机器人数据不可替代
– 固定r,增加h持续提升性能– 但没有机器人数据时(r=0),无论多少人类数据,成功率接近0%
– 原因:重定向后的人类数据仍有域差异,需要真实机器人数据”精调”
• 人机交换率约2:1
– 达到与r=50纯机器人数据相当的性能(绿色区域边界),斜率≈2
– 即2个人类演示 ≈ 1个机器人演示
• 成本效率提升
– 人类演示收集速度是机器人演示的5.2倍
– 考虑2:1交换率,协同训练可将数据收集成本降低约2.6倍
核心启示
• 人类视频是灵巧手预训练的「金矿」:通过精心设计的转换管道,第一人称人类视频可以转化为高质量的机器人预训练数据,scale远超遥操作
• 功能对齐 > 物理对齐:FAAS按功能而非物理关节分组,是跨手部数据共享和零样本迁移的关键
• 3D感知是空间泛化的基石:点云输入天然支持几何编辑式数据增强,使策略在整个工作空间内鲁棒
• 预训练的价值在复杂任务上 exponential 放大:Cut Bags等需要高度灵巧的任务上,预训练版本(90%) vs 无预训练(12.5%)的差距高达77.5pp
• 人机协同训练是降低数据成本的可行路径:2:1交换率 + 5.2倍收集速度 = 约2.6倍成本降低
局限与未来方向
• 尚未利用大规模无动作标注的第一人称活动数据集(如Ego4D),扩展到此是未来的重要方向
• 人类数据的重定向精度仍有提升空间,更精确的IK和接触建模可以进一步减少域差异
• 多模态感知(触觉、力觉)的整合可以进一步提升精细操作的可靠性
本文内容整理自学术论文:《UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos》,仅作学术分享使用,版权归原作者及出版方所有。
• 论文作者:Gu Zhang, Qicheng Xu, Haozhe Zhang, Jianhan Ma, Long He, Yiming Bao, Zeyu Ping, Zhecheng Yuan, Chenhao Lu, Chengbo Yuan, Tianhai Liang, Xiaoyu Tian, Maanping Shao, Feihong Zhang, Mingyu Ding, Yang Gao, Hao Zhao, Hang Zhao, Huazhe Xu
• 发表单位:清华大学、上海期智研究院、中山大学、UNC Chapel Hill
• 项目主页:https://unidex-ai.github.io/
关注【具身智能制造】,每周拆解机器人与 AI 领域顶会,带你紧跟前沿技术~



