大数跨境

谷歌连发三模型,把机器人调教成“全能打工人”!几小时速配、从头控到脚,还能“组团”开干

谷歌连发三模型,把机器人调教成“全能打工人”!几小时速配、从头控到脚,还能“组团”开干 AI前线
2026-07-31
1
导读:“未来的机器人将能与人类并肩工作,解决复杂挑战。”
作者|华卫

7 月 30 日,Google DeepMind 正式发布人工智能模型 Gemini Robotics 2。该模型系列旨在赋予人形机器人及多种形态设备自主适应不可预测环境的能力,通过对每个动作进行独立推理,解锁清理垃圾、拾取物品等广泛任务场景。

此次更新核心在于引入“智能全身控制、高级灵巧操作和多机器人协作”三大能力,标志着机器人技术迈入新阶段。相较于初代系统仅能驱动机械臂完成封口、折纸等精细操作,Gemini Robotics 2 构建了为下一代自适应机器人提供动力的智能层。

该系统支持在设备本地运行,并具备极高的迁移效率,可在数小时内无缝适应全新的机器人本体,实现技能的快速跨机体转移。此外,系统还支持多机器人协同作业,显著提升复杂任务的完成效率。

让 AI 真正融入物理世界,已成为科技巨头角逐通用人工智能(AGI)的关键战场。Google DeepMind 表示,这是迈向“物理 AGI"(即机器人能完成人类所能做的任何事情)的重要里程碑,未来机器人将与人类并肩解决复杂挑战。

实现“智能全身控制”,演示效果惊艳

Google 发布的演示视频展示了搭载 Gemini Robotics 2 平台的机器人执行各类操作的卓越性能。

首先,物理 AI 的应用范围从桌面任务扩展至人形机器人,实现了真正的智能全身控制。例如,Apptronik 的 Apollo 2 人形机器人在接收到“将浇水壶放到底层架子绿色箱内”的指令后,能够自主规划路径,走到桌前拿起水壶,再移动至架子旁精准放置。

其次,为适应家庭和工作场所需求,机器人展现了强大的精细操作能力。视频中,机器人完成了书籍上架、收拾棋盘、将磁带放入录音机以及整理桌面等复杂动作。

Gemini Robotics 2 赋予了不同硬件平台高度灵巧性。通过装载于 Apollo 2 上的 22 自由度五指 SharpaWave 手,机器人可执行打结、密封夹链袋等高难度动作;同时,它也能操控标准两指平行夹爪(如 Franka Duo 平台)完成紧密包装等任务。

据 Google 内部评估,在三种全身操控类别中,成功率介于 45.7% 至 76.3%;在 Franka Duo 抓取器类别中,成功率为 74.2% 至 89.6%;多指任务成功率则在 32% 至 92% 之间。

Google 强调,演示视频均为“完全自主”机器人的实时录像,这与部分竞品依赖远程操作员控制的模式形成鲜明对比。不过需注意,当前模型并非通用型设备,而是针对特定任务经过专门训练(结合人工遥操作、视频示例和模拟),尚无法胜任所有场景。

三大核心模型,建构机器人超级大脑

传统机器人多依赖预先编程或远程操控,缺乏自主学习和适应未知环境的能力,且技能跨本体迁移困难。Google DeepMind 提出,需通过多模型架构赋予机器人智能思考、行动与交互能力,以应对大规模复杂挑战。

Gemini Robotics 2 采用多模态理解架构,包含一个视觉语言模型用于环境理解,以及两个视觉语言动作(VLA)模型分别控制全身和手部动作。DeepMind 团队负责人 Carolina Parada 指出,该系统由三个高度专业化的模型构成:

  • Gemini Robotics 2(VLA 模型):作为最先进的视觉 - 语言 - 动作模型,它将视觉与语言输入转化为马达控制,首次实现从脚到指尖的完整人形机器人智能全身控制,大幅提升双手与夹爪的灵巧度。
  • Gemini Robotics ER 2(具身推理模型):扮演“大脑 Agent"角色,具备与人类沟通、理解物理世界及规划长程多步骤任务的能力。其新增的团队协作功能,允许不同类型的机器人相互通信,协同解决单机无法完成的复杂工作流。该模型能处理涉及数百个决策的任务,并具备自我修正机制。
  • Gemini Robotics On-Device 2(本地端模型):专为无网络延迟或离线环境设计,主打极高适应效率。它原生支持多本体,继承先进的“运动迁移”技术,仅需数小时(通常少于 200 个示例)即可适应形状、传感器和自由度截然不同的新机器人本体。

目前,Gemini Robotics ER 2 已在 Google AI Studio 上线,并在 Gemini Enterprise Agent Platform 开启私人预览;VLA 与本地端模型则仅向早期合作伙伴开放。

增强具身推理,打造最安全机器人模型

面对现实世界的不确定性,安全性成为机器人落地的首要考量。Google DeepMind 采取多层次策略,将传统物理安全措施与强大的 AI 安全框架相结合。

Gemini Robotics 2 推出了 ASIMOV-Agentic 基准,用于评估代理式安全编排和不确定性解决能力。该基准衡量智能体拒绝不安全工具调用、预测任务可行性以及在模糊情境下主动请求人工干预的能力。

得益于增强的具身推理,Gemini Robotics ER 2 在安全约束遵循和人类接近度检测上表现优异,成为迄今最安全的机器人模型。当检测到人类靠近时,机器人能立即停止运作,待人员离开后自主恢复工作,满足协作安全标准的关键要求。

值得注意的是,Google 此次发布的是软件层面的解决方案。尽管美国近期以安全为由限制中国制造机器人的销售,但该软件所适配的众多机器人本体,实际上仍由中国制造。

参考链接:https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/

声明:本文为 AI 前线整理,不代表平台观点,也不构成投资建议,未经许可禁止转载。

【声明】内容源于网络
0
0
AI前线
面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
内容 8665
粉丝 0
AI前线 面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
总阅读181.7k
粉丝0
内容8.7k