大数跨境

ECCV 2026 专访:让大模型「忘掉XYZ」,RoboTracer 用 3D 空间感知与度量推理重塑机器人轨迹追踪

ECCV 2026 专访:让大模型「忘掉XYZ」,RoboTracer 用 3D 空间感知与度量推理重塑机器人轨迹追踪 AI科技评论
2026-09-09
7
导读:用像素坐标加绝对深度表示轨迹,换本体不必重训模型。
采用像素坐标加绝对深度表征轨迹,实现模型跨本体复用无需重训。

    作者丨张   璐

    编辑丨幸丽娟

设想向家庭服务机器人下达指令:“拿水壶从左到右依次给花浇水,喷头需悬停在每朵花上方 1 到 5 厘米处。”
该指令对现有具身系统极具挑战:既需识别物体顺序,又要精准控制绝对深度。2D 轨迹若深度估算错误,将导致碰撞或无效动作。当前系统普遍缺乏带绝对尺度和避障约束的执行能力。
端到端视觉 - 语言 - 动作模型(VLA)虽可直接输出动作,但示教成本高且泛化性差;通用视觉语言模型(VLM)擅长 2D 理解,却缺失绝对尺度感知,难以将 2D 轨迹准确映射至 3D 空间。
针对上述痛点,北航、北大、智源及中科院自动化所等团队提出新方案:不令大模型直接预测关节力矩,而是让 VLM 将指令拆解为带物理尺度的多步 3D 轨迹,再交由运动规划器执行。
团队推出了 RoboTracer 模型及包含约 450 万样本、3000 万问答对的大规模数据集 TraceSpatial。该方案采用图像坐标加度量深度 (u, v, d) 表示轨迹,不绑定特定机器人本体,同一模型可适配 UR5 机械臂与 Unitree G1 人形机器人。
AI 科技评论采访了论文核心作者、北航博士生周恩申。作为 RoboBrain 系列项目的深度参与者,他分享了团队在 3D 尺度监督、纯视觉轨迹局限性及具身智能从“被动感知”迈向“主动感知”的前沿思考。
本文将从表征表达、绝对尺度注入及过程奖励机制三个维度,解析 RoboTracer 如何突破 3D 空间推理瓶颈。

01

大模型为何在 3D 空间中频繁“迷路”?

VLM 从 2D 图像迈向 3D 交互,需同时解决空间指称(物体位置与关系)和尺度度量(实际距离与高度)两大难题。
空间指称、尺度度量与轨迹生成流程示意图

▎摒弃 XYZ 坐标系,采用“像素坐标 + 绝对深度”新范式

直接预测绝对三维坐标 (x, y, z) 面临巨大挑战:互联网数据缺乏 3D 标注,模型需同时学习三维数值与复杂相机参数,易导致训练不稳定。RoboTracer 提出将关键点拆解为图像坐标 (u, v) 与绝对度量深度 d。前两维兼容海量 2D 图文数据,深度 d 作为独立物理量单独处理。这种表征避免了坐标系转换带来的数据断层,下游仅需接入相机内参即可无损还原 3D 坐标。

▎专治“尺度感缺失”,实现厘米级误差纠偏

为解决大模型缺乏空间尺度感的问题,RoboTracer 引入两大核心组件:
1. 基于回归监督的尺度解码器(SFT)
网络引入<SCALE>标记与轻量级 MLP 解码器,在对数空间进行回归以映射真实物理尺度。研究发现,强行统一单位为“米”效果不佳;允许模型根据上下文自由选择单位(米、厘米等),能更好契合预训练阶段的物理先验,显著提升估计精度。
2. 通用的空间编码器
采用模块化解耦设计,不仅支持单目 RGB 图像,还可直接接入深度图或已知内参。实验显示,RGB+ 内参 + 深度的组合使 TraceSpatial-Bench 综合成功率从 39% 提升至 45%。

▎过程重于结果,构建规则化过程奖励机制

传统基于结果的奖励机制在复杂轨迹规划中易失效。RoboTracer 提出免过程奖励模型(PRM)的规则化机制,结合 GRPO 算法微调。模型需以思维链形式显式推演中间感知证据,并通过以下规则打分:
  • 结构化格式校验(R_PF):约束模型按严格格式输出感知类型、目标物体及数值。
  • 分属性度量精度奖励(R_Acc):针对不同感知步骤设定物理误差容忍阈值,符合真实约束即获正向激励。
RoboTracer 总体架构与多步感知推理示例
该设计不强制线性推理顺序,而是精准奖励正确的物理感知依据,最终输出包含可回溯的中间证据链。
消融实验对比:数据配方、空间编码器、尺度监督及不同表征方式对成功率的影响

02

450 万条轨迹数据来源揭秘:三条自动化流水线

为打破 2D 图缺乏尺度、3D 扫描缺乏动态轨迹的数据壁垒,团队构建了包含 450 万高质样本、3000 万问答对的 TraceSpatial 数据集,通过三条自动化流水线合成数据。
TraceSpatial 数据总览:2D 网页图、3D 扫描、操作视频三条流水线

▎流水线一:2D 照片重构伪 3D 场景

清洗约 170 万张开源图片,利用 MoGe-2 进行深度估计,SAM 2.1 进行实例分割。系统将平面图重构为三维点云,标注空间方位关系,批量生成伪 3D 场景图,赋予模型空间相对方位与粗粒度尺度直觉。

▎流水线二:静态场景中自动生成避障轨迹

针对 ScanNet 等静态 3D 扫描数据,团队定义行为模板,利用改进的 RRT*算法在连续 3D 空间采样避障路径,并引入视觉开阔度评估与分离轴定理解决穿模问题。随后根据轨迹反向生成包含空间约束的操作指令。
扫描场景中自动生成的避障轨迹及倒写指令示例

▎流水线三:从真实视频中提取夹爪轨迹

整合 DROID、AgiBot 等真机操作视频及 RoboTwin 2.0 仿真数据。针对外参漂移、遮挡等“脏数据”问题,设计深度一致性校验算法与基于夹爪状态的动作重分割逻辑,精准提取物体中心与末端执行器的 3D 轨迹。

03

实测表现:同一套"3D 路书”跨构型复用

RoboTracer 在标准化基准测试与真实物理世界驱动两个层面接受了严苛检验。
RoboTwin 仿真环境演示:模型拆解长指令生成 3D 轨迹,驱动双臂完成复杂任务

▎基准测试:通用 VLM 成功率仅 3%,RoboTracer 大幅领先

团队构建包含 100 个复杂室内场景的 TraceSpatial-Bench 基准。测试显示,Gemini-2.5-Pro 综合成功率仅为 3%,Qwen3-VL 系列约为 6%-8%。而 RoboTracer 在 RGB 输入加过程奖励下达到 39%,接入相机内参和深度后提升至 45%,显著优于通用大模型。
TraceSpatial-Bench 评测结果对比

▎真机实战:UR5 稳定执行,G1 实现跨构型泛化

RoboTracer 将预测的 3D 轨迹作为高层规划指令,下游对接通用运动规划器。在 UR5 桌面任务中,系统能以 1.5Hz 频率重规划应对动态干扰,成功率约 60%。在 Unitree G1 人形机器人上,无需重训即可实现浇花任务,成功率约 30%,验证了跨构型复用的可行性。

04

结语:具身智能不需要“万能黑盒”

RoboTracer 研究展示了一种务实的解题思维:既不依赖端到端黑盒,也不盲目迷信纯文本模型的空间感知能力。通过将长程规划拆解为空间指称与尺度度量,并以解耦的 (u, v, d) 轨迹作为几何中介,为具身智能架构提供了清晰路径。
当然,纯视觉 3D 轨迹仍存在物理局限,无法承载力控与触觉反馈。未来具身智能的发展方向将从“被动 3D 空间感知”迈向“主动感知(Active Perception)”,即模型能主动调整视角或与环境的交互以获取更多信息。
以下为 AI 科技评论与核心作者周恩申的对话摘录:

▎AI 科技评论:用纯文本监督训练 VLM 做 3D 任务,有何意外发现?

周恩申:只要数据量足够大且质量高,VLM 完全可以建立对三维空间与物理尺度的直觉感知。大模型在预训练阶段已隐式记忆了大量物体的物理尺度分布,关键在于表达方式需顺应这种先验。

▎AI 科技评论:当前从 3D 视觉轨迹到真实物理交互的最大瓶颈是什么?

周恩申:目前的 Spatial Trace 本质是视觉离散点,缺乏力反馈与触觉信号。未来轨迹需演变为 Multimodal Trace,附加力控与触觉模态并形成实时闭环。此外,高动态响应也是现实瓶颈。

▎AI 科技评论:具身智能在空间理解上的下一个爆发点是什么?

周恩申:下一个方向是主动感知(Active Perception)。模型应能意识到当前视角信息不足,并主动转动相机或移动位置重新观察,而非仅被动分析给定图像。
【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8942
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读237.6k
粉丝0
内容8.9k