大数跨境

GPT-6 丝滑「上身」宇树 G1,斯坦福把机器人控制链封装成了一套「专属 API」

GPT-6 丝滑「上身」宇树 G1,斯坦福把机器人控制链封装成了一套「专属 API」 AI科技评论
2026-09-28
1
导读:空间记忆接导航,视觉伺服接抓取,全身运动负责落地。
空间记忆接导航,视觉伺服接抓取,全身运动负责落地。

    作者丨郑佳美

    编辑丨岑   峰

                                                                                                       

近日,斯坦福大学 The Movement Lab 与加州理工学院联合公开了具身智能研究项目 HomeBody。该团队将 GPT Astra 接入宇树科技 Unitree G1 人形机器人,使其能够自主探索陌生厨房环境,并根据指令完成寻找物品、拿取药物、丢弃垃圾及开启抽屉等连续任务。
HomeBody 的核心创新在于其架构设计:机器人并非简单依赖大模型直接输出动作,而是在未知环境中通过探索记录空间位置,任务执行时从历史记忆中检索目标,结合本地控制模块完成导航与操作。这一方案对当前行业主流的端到端 VLA(Vision-Language-Action)模型提出了不同的工程解法。
GPT Astra 在此系统中不直接控制关节,而是负责任务理解、技能选择及失败后的重决策。导航、轨迹规划、碰撞检测、视觉伺服和全身控制等底层能力均运行于机器人本地。这种分层治理模式旨在回答具身智能的核心争议:在 VLM 具备环境与技能理解能力后,语言到动作之间的策略层应如何保留与优化。

标准化机器人 API 接口设计

HomeBody 系统的关键突破在于重新设计了大模型与机器人本体之间的接口。GPT Astra 通过结构化的 tool call 选择技能并提供必要参数,而非直接输出机械臂末端的连续轨迹。
不同动作对应独立的命令空间:Pick 技能接收图像中归一化至 0–1000 的二维点及左右手标识;Navigate 技能接收地图坐标系中的二维目标点与朝向;Place 技能使用躯干坐标系中的三维释放位置;抽屉操作则封装了视觉对准、抓握把手及后退行走等完整流程。
这种设计使大模型仅需关注语义层面的“操作目标”,而将意图转化为几何约束的过程交由底层技能接口处理。Astra 无需理解 G1 的自由度或逆运动学求解细节,只需知晓可用能力及其参数要求。
与紧密耦合训练数据的端到端 VLA 不同,HomeBody 的中间层采用显式接口。抓取可基于解析方法,导航可接入传统规划器,新技能可源自强化学习策略。只要遵循统一协议,上层 VLM 无需知晓底层控制方法。这一设计将扩展难点从重新训练整体策略转移至接口表达能力上。

构建统一坐标系的空间记忆

为解决跨房间任务中视觉语义与真实世界坐标断裂的问题,G1 在执行任务前需先探索环境。系统同步保存相机观测、D435i 双目数据、LiDAR 与 SLAM 信息、关节姿态及 Astra 选择的航点。
随后,Astra 参与 Real2Sim 流程,将观测数据整理为 Isaac Sim 中的数字环境。SLAM 提供实测几何约束,视觉数据补充语义,关节状态与航点则将观测绑定至机器人视角。通过 Super Odometry 获取 G1 在 SLAM 地图中的状态,并利用 ICP(Iterative Closest Point)算法将 SLAM 点云与重建环境配准,实现现实地图与数字环境的空间关系共享。
空间记忆由此分为两层:语义记忆记录关键帧中的物体信息,度量几何记录拍摄时的机器人位置。收到任务后,Astra 可从历史观测中恢复视觉线索,并沿绑定的空间位置引导 Navigate 返回目标区域。相比直接将大量历史图片输入 VLM 上下文,这种空间化记忆更为稳定,由 SLAM 和 Real2Sim 处理尺度、方向与可达性,VLM 仅负责逻辑判断。

从图像点到精准抓取的闭环

Pick 技能接收 Astra 输出的二维点后,系统首先通过分割模块提取目标,利用 Fast-FoundationStereo 根据 D435i 双目图像计算深度。结合相机标定,将像素投影为三维几何,并通过解析方法生成抓取姿态。
运动规划阶段,系统生成 spline reference 并施加 minimum-jerk timing 约束以确保轨迹平滑。同时,检查机械臂从起点到终点扫过体积的碰撞间隙,确保全程安全。
为应对运动过程中的视觉漂移,系统引入 SAM 2.1 跟踪目标,结合 SAMURAI 的 memory selection 维持跨帧状态,并通过 visual servoing 持续修正接近方向。形成分层闭环:小范围误差由 servo loop 修正;若抓取失败,Pick 技能可尝试其他抓取点或调整站位;仅当局部恢复无效时,才将失败原因返回 Astra 进行高层重决策。
各模块时间尺度各异:手臂与手部控制频率为 250 Hz,AMO 更新频率为 50 Hz,而 GPT Astra 的远端推理处于秒级。这种分离避免了网络抖动对底层控制的直接影响。在抽屉操作中,系统结合 AMO 全身控制框架,通过下肢和躯干调整扩大上肢可操作空间,实现复杂动力学下的稳定操作。

具身智能的工程边界与架构启示

HomeBody 目前仍面临工程边界限制:Real2Sim 增加了部署成本,Astra 推理导致技能间停顿,且本地感知规划需高性能算力支持。此外,技能覆盖范围有限,无法仅凭语言推理生成未预定义的接触动力学或处理柔性物体。
然而,该架构指明了具身智能的另一条路径:不追求单一 VLA 模型解决所有问题,而是将空间记忆、任务分解、三维视觉、抓取规划及全身动力学拆解为适合各自表示与控制频率的模块,并通过显式接口连接。
VLM 处理离散决策,SLAM 维护几何空间,视觉模型处理像素深度,规划器处理轨迹约束,AMO 处理身体动力学。人形机器人正逐渐演变为类似复杂软件系统的结构:高层模型负责决策,空间系统维护状态,技能提供标准接口,高频控制层保障物理稳定。
未来具身智能的竞争,不仅在于动作模型的规模,更在于技能接口设计的合理性、空间状态表示的稳定性以及高低频控制边界的清晰度。
参考链接:
https://tml.stanford.edu/homebody/
https://github.com/Stanford-TML/homebody
【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8974
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读258.3k
粉丝0
内容9.0k