一句话洞察
教机器人抓一个新物体需要多少准备工作?
传统方法要么需要昂贵的CAD模型,要么需要几十张不同角度的参考照片。
湖南大学团队提出的SinRef-6D彻底颠覆这一范式——只需要一张RGB-D照片+1分钟人工标注,机器人就能在任意新视角下精准估计物体的6-DoF姿态并执行抓取。
六个基准测试全面领先,真实世界杂乱、遮挡、低光照场景全部拿下。
姿态估计的三条路线,为什么都走不通规模化?
机器人操作未知物体的前提是知道物体在哪里、朝向何方——这就是6-DoF姿态估计(3维旋转+3维平移)。现有方法分三大类,各有致命短板:
方法类别 |
代表工作 |
核心问题 |
CAD模型驱动 |
MegaPose, FoundationPose |
需要精确纹理化的CAD模型,获取成本极高 |
密集参考图 |
FS6D, OnePose, Gen6D |
需要16-200张多角度参考图,采集+存储开销大 |
单张参考图 |
One2Any, Any6D, UNOPose |
只能估计相对姿态,无法直接用于机器人绝对控制 |
SinRef-6D的突破口:单张参考图 + 绝对姿态 + CAD-free + 机器人系统集成——四个关键词同时满足。
【图1|SinRef-6D概览与机器人系统集成】
展示了(a)密集参考图方法的两大痛点:
需要3D重建或模板匹配,计算和内存开销大;(b)SinRef-6D的极简设置:仅需单张参考图;(c)(d)开发的完整硬件-软件机器人系统,包括半自动标注器、姿态估计模块和抓取执行模块。
SinRef-6D架构:迭代对齐的四步流水线
【图2|SinRef-6D四模块框架】
展示了从输入到输出的完整流程:
(a)初始化分割 → (b)点云焦点化到物体坐标系 → (c)Point和RGB SSM提取逐点特征 → (d)逐点对齐求解姿态 → 迭代反馈优化。
模块(a):初始化——背景分割与点云生成
输入一张reference RGB-D图像和一张query RGB-D图像:
• 使用Mask R-CNN或zero-shot CNOS + FastSAM进行物体分割
• 深度图反投影为3D点云
• 输出:reference点云 P(r)和 query点云P(q)(各2048点)
模块(b):点云焦点化——统一到物体坐标系
关键洞察:在物体坐标系中对齐,而非相机坐标系。
• Reference点云:利用已知的6-DoF标注姿态
变换到物体坐标系:
• Query点云:第一次迭代时用平均坐标作为初始平移,后续迭代用上一轮估计的姿态更新
焦点化的好处:几何一致性检查、与类别先验解耦、对未见物体更鲁棒。
模块(c):Point SSM + RGB SSM——从单视图捕获长程空间依赖
【图3|Point SSM架构】
Point SSM首先执行逐点扫描,用K近邻为每个扫描点采样一组邻域点构成token,计算token嵌入并加入位置编码,然后通过Point State Space (PSS)块提取逐点特征
。
【图4|RGB SSM架构】
RGB SSM采用四阶段跨扫描设计,每个阶段使用Visual State Space块提取不同尺度的图像特征,多尺度特征融合后经mask筛选得到
。
为什么选SSM而非Transformer?
• SSM(State Space Model)具有线性复杂度(vs Transformer的二次复杂度)
• 从单视图建模长程空间依赖时效率更高
• S6选择性扫描机制能有效处理点云和RGB的序列特征
最终特征融合:
(逐点融合Point和RGB特征)
模块(d):逐点对齐与姿态求解——双GeoTransformer分工协作
核心挑战:初始query和reference之间可能存在巨大的姿态差异(尤其是旋转),直接对齐容易失败。
SinRef-6D的解决方案:两个不共享权重的GeoTransformer,分别处理 coarse 和 fine 对齐。
GeoTransformer |
职责 |
输入特点 |
第一个(GT-Coarse) |
初始粗略对齐 |
大姿态差异,需要建立大致对应关系 |
第二个(GT-Fine) |
迭代精细细化 |
小姿态差异,需要精确定位优化 |
单次迭代流程:
• Reference和Query特征经GT的self-attention和cross-attention精炼:
• 计算逐点亲和矩阵:
• 选择最高相似度的点进行Weighted SVD求解6-DoF姿态:
• 新姿态反馈到模块(b)更新query点云的焦点化
训练监督:交叉熵损失直接监督逐点亲和矩阵
,强迫模型学习精确的点级对应关系。
机器人系统集成:从姿态估计到物理抓取
【图1(c)(d)|硬件-软件系统架构】
硬件配置
• Yaskawa MOTOMAN-MH12机器人臂
• Intel RealSense L515 RGB-D相机(eye-in-hand配置)
• DH-PGI-140-80电动平行夹爪
三大软件模块
1. 校准模块
• 手眼校准(Hand-Eye Calibration):HALCON-based方法
• 工具校准(Tool Calibration):五点法
2. 姿态估计模块
• 半自动标注器:旋转通过calibration board自动求解,平移和尺寸通过键盘手动微调——每个未见物体<1分钟完成标注
• 姿态推断:对新query视图进行zero-shot姿态估计
3. 抓取模块
• 深度排序的多物体连续抓取策略
• 3-DoF平移确定抓取点,物体坐标系z轴定义抓取方向
• 安全处理:抓取点 tabletop 上方抬升2cm,非平面放置时夹持方向clamp至30°以内
实验结果:六个基准全面领先
vs 密集参考图方法:用1/16到1/200的数据量打平或超越
【表1|LineMod数据集ADD-0.1d对比】
• 仅用1张参考图,SinRef-6D达到90.3%(随机)和90.8%(手动选择),与使用16-200张图的LatentFusion和FS6D持平
• 无需3D重建、无需模板匹配,模型复杂度和推理效率显著优于基线

【表2|YCB-V完整数据集AUC of ADD对比】
SinRef-6D在YCB-V的21个物体上进行了逐对象评估。整体AUC表现优异,但对于扁平或几何复杂的物体(如extra-large clamp)精度较低——这类物体从单参考图难以准确感知。
vs CAD模型方法:CAD-free达到同等水平

【表4|五个BOP数据集BOP Metric (AR)对比】
使用Mask R-CNN分割时:
• SinRef-6D:64.6% AR
• 超过MegaPose(58.0%)和ZeroPose(56.8%)
• 甚至超过MegaPose+Refinement后的60.8%
使用zero-shot CNOS分割时:
• SinRef-6D:58.6% AR(因CNOS多实例重复估计导致推理时间增加)
关键对比对象:
• FoundationPose(单参考图设置):~10倍慢于SinRef-6D(需要3D重建)
• SAM-6D:需要纹理化CAD模型
• SinRef-6D是唯一CAD-free、refinement-free、且速度最快的方法
vs 其他单参考图方法:精度全面超越

【表5|单参考图方法对比】
方法 |
LM ADD-0.1d |
LM-O AR |
TUD-L AR |
UNOPose |
56.8 |
30.5 |
41.8 |
One2Any |
51.2 |
28.4 |
34.3 |
Any6D |
50.3 |
29.6 |
39.8 |
SinRef-6D |
57.3 |
34.8 |
46.6 |
SinRef-6D在所有三个数据集上均领先,LM-O上比次优UNOPose高4.3pp。
真实世界机器人抓取

【图8|真实世界定性结果】
四个场景验证:
•正常场景:平面放置的多物体,精准估计姿态并成功抓取
• 杂乱场景:多物体紧密堆叠,仍能准确识别目标物体
• 遮挡场景:部分物体被遮挡,姿态估计保持鲁棒
•低光照场景:暗光条件下依然有效

【图9|真实世界抓取执行】
展示了多物体连续抓取的全过程:先估计所有物体的6-DoF姿态(左上角),按深度排序确定抓取顺序,依次执行抓取并放置到目标位置。
非平面放置:底部两行展示了物体倒置或非平面放置时的挑战场景——这是真实世界常见但现有方法很少处理的情况。消融实验:解构设计选择
迭代对齐次数

【表VII(文中提及)|迭代次数与双GeoTransformer消融】
• 单GeoTransformer共享权重:难以同时处理 coarse 和 fine 对齐,精度下降
• 两个共享权重的GT:不如不共享权重,因为 coarse 和 fine 的输入分布差异大
• 两个不共享权重的GT(最终设计):最优,各自专注于不同的对齐阶段
参考图选择策略
• 随机选择(GigaPose渲染方式):90.3%
• 手动选择(接近操作视角):90.8%
• 差距仅0.5%——SinRef-6D对参考图选择不敏感,进一步证明了可扩展性
分割方法鲁棒性
Mask R-CNN(64.6% AR)> 零样本CNOS(58.6% AR)——分割质量直接影响姿态估计精度,但即使使用零样本分割器仍保持竞争力。
失败案例分析
【图7|失败案例】
公共数据集上的失败模式:
• Top-down视角:参考图为倾斜角度,query为俯视时几何特征不足
• 反光金属/透明材质:深度信息缺失导致点云质量差
• 大视角差距:reference与query视角差异过大(>120°)
真实世界的失败模式:
• 非平面放置:物体倒置或侧放时,单参考图难以覆盖所有几何特征
• 严重自遮挡:物体的某些面在参考图中完全不可见
• 大reference-query视角差异:超过模型的对齐能力
核心启示
• 单张图就能做好姿态估计:SinRef-6D证明,在精心设计的迭代对齐框架下,单张参考图包含的信息足以支持高精度的6-DoF绝对姿态估计
• SSM是单视图空间建模的高效选择:线性复杂度使其在实时机器人应用中比Transformer更具优势
• 双GeoTransformer分工是处理大姿态差异的关键:coarse和fine的对齐问题本质不同,需要专门的模型分别处理
• 物体坐标系焦点化是鲁棒性的基石:在物体坐标系中对齐,与类别先验解耦,天然对未见物体友好
• <1分钟的标注成本让规模化成为可能:半自动标注器将参考图获取从”工程任务”降级为”点几下键盘”
本文内容整理自学术论文:
《Scalable Unseen Objects 6-DoF Absolute Pose Estimation With Robotic Integration》(IEEE Transactions on Robotics, Vol. 42, 2026)
仅作学术分享使用,版权归原作者及出版方所有。
• 论文作者:Jian Liu, Wei Sun, Kai Zeng, Jin Zheng, Hui Yang, Hossein Rahmani, Ajmal Mian, Lin Wang
• 发表单位:湖南大学、中南大学、Lancaster University、University of Western Australia、Nanyang Technological University
关注【具身智能制造】,每周拆解机器人与 AI 领域顶会,带你紧跟前沿技术~


