作者丨张 璐
编辑丨幸丽娟
01
大模型为何在 3D 空间中频繁“迷路”?
▎摒弃 XYZ 坐标系,采用“像素坐标 + 绝对深度”新范式
▎专治“尺度感缺失”,实现厘米级误差纠偏
▎过程重于结果,构建规则化过程奖励机制
-
结构化格式校验(R_PF):约束模型按严格格式输出感知类型、目标物体及数值。 -
分属性度量精度奖励(R_Acc):针对不同感知步骤设定物理误差容忍阈值,符合真实约束即获正向激励。
02
450 万条轨迹数据来源揭秘:三条自动化流水线
▎流水线一:2D 照片重构伪 3D 场景
▎流水线二:静态场景中自动生成避障轨迹
▎流水线三:从真实视频中提取夹爪轨迹
03
实测表现:同一套"3D 路书”跨构型复用
▎基准测试:通用 VLM 成功率仅 3%,RoboTracer 大幅领先
▎真机实战:UR5 稳定执行,G1 实现跨构型泛化
04
结语:具身智能不需要“万能黑盒”
▎AI 科技评论:用纯文本监督训练 VLM 做 3D 任务,有何意外发现?
▎AI 科技评论:当前从 3D 视觉轨迹到真实物理交互的最大瓶颈是什么?
▎AI 科技评论:具身智能在空间理解上的下一个爆发点是什么?

