在一项双机器人协作测试中,研究人员故意让其中一台机器人延迟 3 秒。另一台机器人在未收到额外提示且无法读取伙伴内部状态的情况下,并未按既定节奏继续移动,而是主动减速等待,维持接触并根据对方动作重新调整时序。结果显示,这段延迟几乎未影响任务成功率。
这项测试源于芝诺机器人(Zeno AI)近期发布的 Zeno-1。这是一个拥有 30 亿参数、面向协作物理智能的基础模型,旨在解决机器人领域长期被忽视的核心问题:如何让机器人学会协同工作,而非仅仅提升单机智能。
从单体智能到群体协作的范式跃迁
对人类而言,协作中的等待近乎本能。但在机器人领域,即便两台机器人都掌握了抓取和拉动技能,若缺乏对伙伴状态的感知,一方过早发力可能导致任务失败。过去几年,机器人基础模型主要聚焦于提升单体能力,如环境识别、指令理解及工具使用。然而,当多个机器人进入同一任务空间,伙伴不仅是环境的一部分,更是持续决策的行动者,其每一次动作都会改变物理世界的状态。
传统的多机器人协作多局限于仓储物流中的调度层面,由中央系统分配任务以避免路径冲突。而 Zeno-1 关注的是操作过程中的实时协调:在共同搬运、物品交接或柔性物体操作中,机器人需在接触瞬间判断伙伴是否准备好,并动态调整自身动作。芝诺团队将这一理念概括为:“物理世界本身就是协作界面”。
视频丨两个机器人协作整理床铺(来源:Zeno AI)
Zeno-1 采用去中心化架构,同一模型独立运行于每台机器人上,无需中央控制器或读取伙伴内部状态。机器人仅依据自身的视觉观察、本体状态和交互历史行动。在评估中,该策略可连续运行超过 10 分钟,完成共享物体搬运、工具使用等多个子任务,且中途无需重置环境或切换策略。
闭环伙伴交互:解决协作数据稀缺难题
长时协作要求机器人具备记忆能力,以区分相似画面下的不同交互阶段,并避免误差累积。针对协作数据稀缺的痛点,Zeno-1 引入了闭环伙伴交互训练(Closed-loop Partner Interaction,CPI)。研究团队先让机器人通过视频和真机示范获得基本操作能力,再使其在真实伙伴交互中暴露延迟、偏差等薄弱环节,并将这些数据转化为新的训练样本。
芝诺机器人联合创始人兼首席科学家植伟铭指出,个体能力是协作的起点,但不会自然转化为协作能力。机器人学会抓取后,还需重新学习如何等待、让步和适应伙伴。围绕 Zeno-1 的技术路线与产业前景,DeepTech 与植伟铭进行了深入对话。
DeepTech 对话植伟铭:定义协作智能新边界
为何选择协作智能作为核心方向?
DeepTech:芝诺如何定义自身定位?为何在单体能力提升的背景下,进一步布局多机器人协作?
植伟铭:芝诺致力于成为以 Foundation Model 为核心的全栈 Physical AI 公司。过去行业聚焦于提升单机的灵巧性与泛化性,但现实世界的任务往往需要群体协作。当单体能力达到一定阈值,瓶颈将转变为“多个机器人如何在同一物理世界中协同”。因此,我们将 Collaborative Intelligence(协作智能)视为物理 AI 发展的必然阶段,Zeno-1 正是让机器人从“学会做事”迈向“学会一起做事”的关键探索。
Zeno-1 与传统多机器人调度的本质区别
DeepTech:亚马逊等企业的机器人舰队已实现大规模调度,Zeno-1 所说的“协作”与之有何不同?
植伟铭:传统系统如 DeepFleet 主要解决路径规划和任务调度,属于 Multi-robot Planning 范畴,机器人间耦合较弱。而 Zeno-1 聚焦于 Contact-rich Collaborative Behaviour(接触密集型协作行为),研究机器人如何直接从数据中学习实时依赖关系。例如在共同搬运柔性物体时,一个机器人的动作会直接改变另一个的可行动作空间。Zeno-1 通过 CPI 学习何时等待、让步或调整,这是一种从数据中学习协作物理行为的新范式。
个体能力与协作能力的辩证关系
DeepTech:协作能力是否能从个体能力中自然涌现?
植伟铭:个体能力是必要条件,但非充分条件。两个具备技能的机器人若缺乏协作策略,仍可能因时序不兼容而失败。Zeno-1 的训练分为两个阶段:首先通过预训练和单体具身适配解决“会不会做事”,随后通过 CPI 和定向纠偏训练解决“能否根据伙伴行为调整自己”。我们有意改变了训练数据的分布,让机器人在真实交互中学习适应。
去中心化架构与物理世界作为接口
DeepTech:为何选择不依赖显式通信的去中心化架构?
植伟铭:去中心化执行避免了系统对中央控制器的依赖,支持机器人异步运行及规模扩展。更重要的是,真实世界中伙伴的移动、抓握和物体姿态变化本身就在传递信息。我们不排斥通信,但主张协作能力不应以完美通信为前提。物理世界本身就是最强的通信渠道,机器人应学会利用这些隐含信号进行协调。
视频丨三个机器人收集一床被子(来源:Zeno AI)
模型规模与实时闭环的平衡
DeepTech:Zeno-1 为何选择 30 亿参数量?
植伟铭:机器人模型必须进入实时闭环,推理速度直接关乎控制能力。30 亿参数是在表征能力与实时控制之间取得的平衡,优化后的部署栈可支持 30Hz 的闭环视觉—运动推理。盲目增加参数量若导致控制频率下降,在接触密集型任务中反而会导致能力退化。
从实验室研究走向规模化部署
DeepTech:未来五到十年,机器人协作成熟的标志是什么?
植伟铭:成熟的协作不应要求机器人完全同质化。未来将是不同形态、不同能力的机器人甚至人机互补的时代。真正的成熟标志是无需为协作编写大量规则,只需告知任务目标,机器人即可自主分工、动态重组,并在故障或环境变化时自我修复。届时,系统智能将随智能体数量和互补性呈指数级放大。
芝诺机器人团队由中美澳三地研发中心组成,核心成员多为具备全栈能力的年轻学者,涵盖基础模型、机器人学习、硬件系统及真实部署等领域。Zeno-1 虽目前是一项前沿研究成果,但其设计初衷即面向实际部署,旨在将协同智能打造为可靠、可泛化的基础能力,推动机器人从实验室走向工厂、仓库及家庭场景。
图丨Zeno-1 在延迟条件下仍保持协调,而基于同步演示训练的策略则会迅速失效。(来源:Zeno AI)
注:封面/首图由 AI 辅助生成