大数跨境

【IEEE T-RO】SinRef-6D:只看一眼,机器人就能精准抓取从未见过的物体

【IEEE T-RO】SinRef-6D:只看一眼,机器人就能精准抓取从未见过的物体 具身智能制造
2026-07-14
2
导读:单张参考图估计6-DoF绝对姿态,迭代SSM对齐 + 双GeoTransformer细化,真实世界杂乱/遮挡/低光照场景全面验证
A4纸张海报.png


一句话洞察

教机器人抓一个新物体需要多少准备工作?

传统方法要么需要昂贵的CAD模型,要么需要几十张不同角度的参考照片。

湖南大学团队提出的SinRef-6D彻底颠覆这一范式——只需要一张RGB-D照片+1分钟人工标注,机器人就能在任意新视角下精准估计物体的6-DoF姿态并执行抓取。

六个基准测试全面领先,真实世界杂乱、遮挡、低光照场景全部拿下。

01

姿态估计的三条路线,为什么都走不通规模化?

机器人操作未知物体的前提是知道物体在哪里、朝向何方——这就是6-DoF姿态估计(3维旋转+3维平移)。现有方法分三大类,各有致命短板:

方法类别

代表工作

核心问题

CAD模型驱动

MegaPose, FoundationPose

需要精确纹理化的CAD模型,获取成本极高

密集参考图

FS6D, OnePose, Gen6D

需要16-200张多角度参考图,采集+存储开销大

单张参考图

One2Any, Any6D, UNOPose

只能估计相对姿态,无法直接用于机器人绝对控制

  SinRef-6D的突破口:单张参考图 + 绝对姿态 + CAD-free + 机器人系统集成——四个关键词同时满足。

【图1SinRef-6D概览与机器人系统集成

展示了(a)密集参考图方法的两大痛点:

需要3D重建或模板匹配,计算和内存开销大;(b)SinRef-6D的极简设置:仅需单张参考图;(c)(d)开发的完整硬件-软件机器人系统,包括半自动标注器、姿态估计模块和抓取执行模块。



















02

SinRef-6D架构:迭代对齐的四步流水线

【图2SinRef-6D四模块框架

展示了从输入到输出的完整流程:

(a)初始化分割 → (b)点云焦点化到物体坐标系 → (c)Point和RGB SSM提取逐点特征 → (d)逐点对齐求解姿态 → 迭代反馈优化。

模块(a):初始化——背景分割与点云生成

输入一张reference RGB-D图像和一张query RGB-D图像:

•  使用Mask R-CNN或zero-shot CNOS + FastSAM进行物体分割 

•  深度图反投影为3D点云 

•  输出:reference点云 P(r)和 query点云P(q)(各2048点)

模块(b):点云焦点化——统一到物体坐标系

关键洞察:在物体坐标系中对齐,而非相机坐标系

 Reference点云:利用已知的6-DoF标注姿态 image.png 变换到物体坐标系:image.png

 Query点云:第一次迭代时用平均坐标作为初始平移,后续迭代用上一轮估计的姿态更新

焦点化的好处:几何一致性检查、与类别先验解耦、对未见物体更鲁棒。

模块(c):Point SSM + RGB SSM——从单视图捕获长程空间依赖

【图3Point SSM架构】 

Point SSM首先执行逐点扫描,用K近邻为每个扫描点采样一组邻域点构成token,计算token嵌入并加入位置编码,然后通过Point State Space (PSS)块提取逐点特征 image.png

【图4RGB SSM架构】 

RGB SSM采用四阶段跨扫描设计,每个阶段使用Visual State Space块提取不同尺度的图像特征,多尺度特征融合后经mask筛选得到 

 为什么选SSM而非Transformer 

  SSM(State Space Model)具有线性复杂度(vs Transformer的二次复杂度) 

  从单视图建模长程空间依赖时效率更高 

  S6选择性扫描机制能有效处理点云和RGB的序列特征

最终特征融合:image.png(逐点融合Point和RGB特征)

模块(d):逐点对齐与姿态求解——双GeoTransformer分工协作

核心挑战:初始query和reference之间可能存在巨大的姿态差异(尤其是旋转),直接对齐容易失败。

SinRef-6D的解决方案两个不共享权重的GeoTransformer,分别处理 coarse 和 fine 对齐


GeoTransformer

职责

输入特点

第一个(GT-Coarse

初始粗略对齐

大姿态差异,需要建立大致对应关系

第二个(GT-Fine

迭代精细细化

小姿态差异,需要精确定位优化

单次迭代流程: 

• Reference和Query特征经GT的self-attention和cross-attention精炼:image.png

•  计算逐点亲和矩阵:image.png 

•  选择最高相似度的点进行Weighted SVD求解6-DoF姿态:image.png 

•  新姿态反馈到模块(b)更新query点云的焦点化

训练监督:交叉熵损失直接监督逐点亲和矩阵 image.png,强迫模型学习精确的点级对应关系。




03

机器人系统集成:从姿态估计到物理抓取

image.png【图1(c)(d)|硬件-软件系统架构】

硬件配置

 Yaskawa MOTOMAN-MH12机器人臂

 Intel RealSense L515 RGB-D相机(eye-in-hand配置)

 DH-PGI-140-80电动平行夹爪

三大软件模块

 1. 校准模块 

• 手眼校准(Hand-Eye Calibration):HALCON-based方法 

工具校准(Tool Calibration):五点法

  2. 姿态估计模块 

• 半自动标注器:旋转通过calibration board自动求解,平移和尺寸通过键盘手动微调——每个未见物体<1分钟完成标注 

• 姿态推断:对新query视图进行zero-shot姿态估计

  3. 抓取模块 

• 深度排序的多物体连续抓取策略 

• 3-DoF平移确定抓取点,物体坐标系z轴定义抓取方向 

• 安全处理:抓取点 tabletop 上方抬升2cm,非平面放置时夹持方向clamp至30°以内










04

实验结果:六个基准全面领先

vs 密集参考图方法:用1/16到1/200的数据量打平或超越

image.png

【表1LineMod数据集ADD-0.1d对比】

 仅用1张参考图,SinRef-6D达到90.3%(随机)和90.8%(手动选择),与使用16-200张图的LatentFusion和FS6D持平

 无需3D重建、无需模板匹配,模型复杂度和推理效率显著优于基线

image.png

【表2YCB-V完整数据集AUC of ADD对比】

SinRef-6D在YCB-V的21个物体上进行了逐对象评估。整体AUC表现优异,但对于扁平或几何复杂的物体(如extra-large clamp)精度较低——这类物体从单参考图难以准确感知。

vs CAD模型方法:CAD-free达到同等水平

image.png

【表4|五个BOP数据集BOP Metric (AR)对比】

使用Mask R-CNN分割时: 

•  SinRef-6D:64.6% AR 

• 超过MegaPose(58.0%)和ZeroPose(56.8%) 

• 甚至超过MegaPose+Refinement后的60.8%

使用zero-shot CNOS分割时: 

•  SinRef-6D:58.6% AR(因CNOS多实例重复估计导致推理时间增加)

关键对比对象: 

•  FoundationPose(单参考图设置):~10倍慢于SinRef-6D(需要3D重建) 

 SAM-6D:需要纹理化CAD模型 

  SinRef-6D是唯一CAD-freerefinement-free、且速度最快的方法

vs 其他单参考图方法:精度全面超越

image.png

【表5|单参考图方法对比】

方法

LM ADD-0.1d

LM-O AR

TUD-L AR

UNOPose

56.8

30.5

41.8

One2Any

51.2

28.4

34.3

Any6D

50.3

29.6

39.8

SinRef-6D

57.3

34.8

46.6

SinRef-6D在所有三个数据集上均领先,LM-O上比次优UNOPose高4.3pp。

真实世界机器人抓取

image.png

【图8|真实世界定性结果】

四个场景验证: 

正常场景:平面放置的多物体,精准估计姿态并成功抓取 

• 杂乱场景:多物体紧密堆叠,仍能准确识别目标物体 

• 遮挡场景:部分物体被遮挡,姿态估计保持鲁棒 

低光照场景:暗光条件下依然有效

image.png

【图9|真实世界抓取执行】

展示了多物体连续抓取的全过程:先估计所有物体的6-DoF姿态(左上角),按深度排序确定抓取顺序,依次执行抓取并放置到目标位置。

非平面放置:底部两行展示了物体倒置或非平面放置时的挑战场景——这是真实世界常见但现有方法很少处理的情况。

05

消融实验:解构设计选择

迭代对齐次数

image.png

【表VII(文中提及)|迭代次数与双GeoTransformer消融】

 单GeoTransformer共享权重:难以同时处理 coarse 和 fine 对齐,精度下降

 两个共享权重的GT:不如不共享权重,因为 coarse 和 fine 的输入分布差异大

 两个不共享权重的GT(最终设计):最优,各自专注于不同的对齐阶段

 参考图选择策略

 随机选择(GigaPose渲染方式):90.3%

 手动选择(接近操作视角):90.8%

 差距仅0.5%——SinRef-6D对参考图选择不敏感,进一步证明了可扩展性

 分割方法鲁棒性

Mask R-CNN(64.6% AR)> 零样本CNOS(58.6% AR)——分割质量直接影响姿态估计精度,但即使使用零样本分割器仍保持竞争力。

06

失败案例分析

image.png

【图7|失败案例】

公共数据集上的失败模式:

 • Top-down视角:参考图为倾斜角度,query为俯视时几何特征不足 

• 反光金属/透明材质:深度信息缺失导致点云质量差 

• 大视角差距:reference与query视角差异过大(>120°)

真实世界的失败模式: 

• 非平面放置:物体倒置或侧放时,单参考图难以覆盖所有几何特征 

• 严重自遮挡:物体的某些面在参考图中完全不可见 

• reference-query视角差异:超过模型的对齐能力

07

核心启示

• 单张图就能做好姿态估计:SinRef-6D证明,在精心设计的迭代对齐框架下,单张参考图包含的信息足以支持高精度的6-DoF绝对姿态估计

• SSM是单视图空间建模的高效选择:线性复杂度使其在实时机器人应用中比Transformer更具优势

• 双GeoTransformer分工是处理大姿态差异的关键:coarse和fine的对齐问题本质不同,需要专门的模型分别处理

• 物体坐标系焦点化是鲁棒性的基石:在物体坐标系中对齐,与类别先验解耦,天然对未见物体友好

• <1分钟的标注成本让规模化成为可能:半自动标注器将参考图获取从”工程任务”降级为”点几下键盘”

本文内容整理自学术论文:

Scalable Unseen Objects 6-DoF Absolute Pose Estimation With Robotic Integration》(IEEE Transactions on Robotics, Vol. 42, 2026

仅作学术分享使用,版权归原作者及出版方所有。

 论文作者:Jian Liu, Wei Sun, Kai Zeng, Jin Zheng, Hui Yang, Hossein Rahmani, Ajmal Mian, Lin Wang   

 发表单位:湖南大学、中南大学、Lancaster University、University of Western Australia、Nanyang Technological University


关注【具身智能制造】,每周拆解机器人与 AI 领域顶会,带你紧跟前沿技术~

【声明】内容源于网络
0
0
具身智能制造
深耕尖端工业智能决策系统研发,涵盖高算力云化控制器与工业具身智造底座等产品,致力于实现我国高端制造与智能制造技术的自主可控!诚邀各界英才携手共进,共创行业新未来~
内容 52
粉丝 0
具身智能制造 深耕尖端工业智能决策系统研发,涵盖高算力云化控制器与工业具身智造底座等产品,致力于实现我国高端制造与智能制造技术的自主可控!诚邀各界英才携手共进,共创行业新未来~
总阅读334
粉丝0
内容52