9月16日,乐享科技在上海进行了一场全球首次户外机器人全自主直播,线上观看人次超550万。现场两台搭载以太大模型(Aether)的机器人——负责点单传菜的“二爷”与负责烧烤的“五弟”,在无预设脚本、无遥操作兜底的真实街头环境中,自主连续完成了近一小时的烧烤服务。面对顾客临时加单、插话等突发状况,机器人不仅能灵活应对,还能保持原有任务进度,为观察具身大模型在开放环境中的表现提供了绝佳窗口。
无脚本直播考验:机器人展现自主决策与任务记忆能力
图|乐享科技机器人在户外烧烤现场操作(来源:乐享科技)
直播中,“二爷”接到顾客“少放辣”或“拿瓶水”等临时需求后,能自主通过手势将信息传递给“五弟”。这种双机协作并未预设交互触发条件,全凭现场情况自主完成。更关键的是,机器人在处理临时插入任务时,能准确分辨并保留此前的任务记忆,待新需求处理完毕后继续未完成的工作,而非清空进度。这证明了其已摆脱对预设程序的依赖,具备在复杂变化中维持任务推进的能力。
技术路径解析:从VLA到“能量驱动”的以太大模型
处理环境变化要求机器人能基于实时环境自主理解与决策。目前主流的视觉—语言—动作模型(VLA,如OpenVLA)通过将场景和指令映射为动作来实现,但受限于训练数据的覆盖范围;世界动作模型(WAM,如Dreamer)虽注重“想后做”的环境预测,但精确建模复杂物理环境的计算与数据成本极高。面对现实世界无法穷举的变化,两者均面临瓶颈。
图|OpenVLA 工作原理示意图(来源:OpenVLA)
对此,乐享科技提出了“能量驱动”路径。其以太大模型将目标完成度、物理后果、记忆一致性等纳入统一的能量函数,模型沿能量梯度持续推理与动作生成。通俗而言,系统通过统一的能量评价机制,寻找既接近目标又满足执行条件的最优方案,让信息获取、任务判断与动作生成围绕共同目标高效协同。
图|能量模型的计算图(来源:Alfredo Canziani)
仿生架构与自我迭代:构建跨本体协作与持续进化能力
为支撑能量驱动模型,以太大模型采用了“仿生架构”,参照人脑功能进行模块化分工:从“上丘”的主动信息获取、“角回”的多模态感知,到“内嗅皮层”的情景记忆编码与“顶上小叶”的物理约束模型,再到“前额叶”推理、“运动皮层”轨迹规划及“小脑”执行。这种分层设计确保不同程度的反馈能到达相应模块并触发有效调整。
图|Aether 仿生架构(来源:以太大模型 Aether 官网)
基于此架构,机器人展现出强大的“跨本体”协作能力。在演示中,一矮一高两台不同品牌机器人协作放置围巾,矮机器人尝试垫高未果后,高机器人顺利接手。同一套模型能理解共同任务,并根据不同机器人的身体条件(身高、臂长等)自主选择可行路径。此外,系统具备“自我迭代”能力,机器人会将执行结果与预测比对,把可靠的规律写入长期记忆,相当于给自己建“错题本”,从而实现能力的持续进化。
图|两个机器人相互配合(来源:乐享科技)
迈向通用具身智能:在真实世界中定义能力边界
近一小时的户外烧烤直播,虽不足以完全验证长期稳定性,但清晰展示了机器人在连续服务中自主判断、持续行动与进化的潜力。对具身智能而言,真正的能力边界必须在真实世界中被定义。机器人走向通用,核心在于形成持续理解、判断和自我调整的能力,而以太大模型正沿此方向,探索具身智能的下一阶段。

