大数跨境

The Batch: 969 | 谷歌的机器人模型有了腿

The Batch: 969 | 谷歌的机器人模型有了腿 DeeplearningAl
2026-08-19
4

谷歌发布 Gemini Robotics 2:首个人形机器人全身控制模型

谷歌最新发布的视觉 - 语言 - 动作模型 Gemini Robotics 2(GR2),已实现让人形机器人完成行走、蹲下取物及精细手部操作等复杂任务。这是谷歌首个利用同一组权重同时驱动腿部与手部的机器人模型,显著简化了训练流程与系统设计。

核心亮点:GR2 能将相机图像与文本指令转化为机器人关节控制命令。不同于早期仅驱动上半身的模型,GR2 可协同控制人形机器人的腿、躯干、手臂及手部。其单一训练权重即可适配三种不同的机器配置,涵盖两种机器人本体。

✴ 输入输出:输入为相机图像和文本指令,输出为关节命令;支持 22 自由度五指手(Sharpa/Inspire)及双指夹爪(Robotiq)。

✴ 多本体适配:单检查点可运行于 Apptronik Apollo 2(配 Sharpa 或 Inspire 手)及 Franka Duo 双臂系统(配 Robotiq 夹爪)。

✴ 性能表现:全身拾取成功率 45.7%-76.3%,多指任务 32%-92%,夹爪任务 74.2%-89.6%。

✴ 可用性:仅限早期访问合作伙伴,暂无公开 API。

✴ 信息披露:谷歌未发布模型卡,参数量、训练数据构成及定价等细节暂未公开。

工作原理与技术架构

双模型协同:GR2 与独立推理模型 Gemini Robotics ER 2 配对使用。ER 2 负责任务拆解与步骤规划,逐个调用 GR2 执行具体动作。由于缺乏技术论文,目前主要依据官方安全报告与公告。

✴ 训练方式:结合遥操作(远程人工操控记录)、视频示例与仿真数据进行训练。

✴ 运动迁移技术:沿用 Gemini Robotics 1.5 引入的运动迁移能力,利用跨形态、跨传感器及不同关节数量的数据训练单一模型,实现数据在不同机器配置间的通用学习。

实测性能数据

谷歌在自定义任务与硬件上完成了内部评测,尚未有第三方测试结果。基线对比显示,2025 年 3 月发布的首个机器人模型在类似任务中平均得分为 63%。

✴ 全身拾取(Apollo 2 + Inspire 手):利用腿部辅助,从架子、桌面、地面拾取的成功率分别为 76.3%、68.4% 和 45.7%。

✴ 精细操作(Apollo 2 + Sharpa 手):系垃圾袋成功率 44%,封合拉链袋 40%,用簸箕清扫 32%。

✴ 双臂任务(Franka 机器人):精确插入、工具配套及通用抓取放置的平均成功率分别为 89.6%、78.9% 和 74.2%。

✴ 推理判断(ER 2 模型):在获知详细训练摘要时,对任务物理可行性的判断正确率达 95.8%;若无摘要,正确率仅为 62.0%。

✴ 安全基准(ASIMOV-Agentic):测试表明,现有系统难以兼顾“发现动态危险”与“避免无意义停止”。若将误停率控制在 5% 以下,漏报人体靠近的风险将超过 40%。谷歌建议模型需与传统物理安全设备配合使用。

典型案例:拧灯泡任务的挑战

测试数据显示,看似简单的反向操作在机器人领域极具挑战。拧下灯泡(从稳定状态开始)成功率高达 92%,而拧入灯泡(需先对齐再抓握旋转)成功率仅为 36%。

行业意义与展望

生态更新:此次发布同步更新了推理模型 ER 2 及端侧模型 Gemini Robotics On-Device 2。后者支持离线运行,并能在数小时内利用少于 200 个示例适配陌生的双臂本体。

突破瓶颈:传统机器人模型往往受限于特定任务、机器与环境,变量变更即需重新训练。GR2 致力于构建类似 Transformer 语言模型的通用性,通过更通用的数据学习,实现知识在不同手部类型、关节数量及任务间的有效迁移,解决机器人运动数据语料库规模不足的难题。

编者观察:按目前 36% 的拧入灯泡成功率计算,完成该任务平均可能需要近三台机器人协同或重试,反映出精细操作仍是当前具身智能的攻坚方向。

【声明】内容源于网络
0
0
DeeplearningAl
吴恩达老师的人工智能教育传播平台.
内容 1319
粉丝 0
DeeplearningAl 吴恩达老师的人工智能教育传播平台.
总阅读19.6k
粉丝0
内容1.3k