大数跨境

人形之外,擎羽把“身体”变成具身智能的新变量

人形之外,擎羽把“身体”变成具身智能的新变量 量子位
2026-08-12
8
导读:从柔性本体走向跨本体基础智能,让任务与世界知识延续

机器人身体正成为具身智能领域被低估的关键变量。过去两年,资本与人才大量涌入人形机器人赛道,其核心逻辑在于人形结构能直接复用人类现有的物理基础设施。然而,追求通用性也将动态平衡、高自由度控制及开放环境泛化等难题压缩至同一系统。

随着产业落地深入,一个关键问题浮现:通用机器人是否必须依赖通用身体?李飞飞曾指出,当任务边界明确时,最高效的身体形态可能完全不同于人类。这正是擎羽科技(FEAGINE)的技术出发点。

香港大学机器人学博士彭锐创立的擎羽科技,汇聚了来自斯坦福、清华、普林斯顿及大疆等顶尖机构的人才。该公司并未简单复制人体,而是将“身体”作为可重新设计的变量,发布了 FEAGINE A01、A02、A03 三款仿生柔性机器人,以及第一代跨本体基础模型 Fi0(Foundation Intelligence Across Embodiments)。前者探索身体的多样性,后者解决智能在不同身体间的复用问题,共同构成了“柔性具身智能”的技术路线。

人形之外,具身智能的身体仍有巨大设计空间

传统柔性机器人多关注材料与机械结构的柔顺性,而擎羽提出的“柔性具身智能”概念更为深远。它是以可连续形变、可顺应接触的机器人为本体基础,将身体结构参数、实时形态、感知及驱动能力纳入模型上下文。这使得任务知识与世界理解能够跨越不同身体复用,并由模型为当前特定身体生成适配行动。

擎羽认为,未来的机器人市场将呈现多元化身体结构:通用性由共享智能提供,而每一种身体则围绕特定任务和环境实现效率最大化。友善的本体、丰富的数据与泛化的模型,是机器人进入真实生活空间的三大核心要素。

全球首个量产绳驱柔性本体产品矩阵

FEAGINE A01、A02 和 A03 构成了全球首个实现标准化量产交付的绳驱柔性本体产品矩阵。三款产品在节段数量、自由度、长度及负载能力上逐级递进,以适应不同部署需求:

  • A01:单节段、2 自由度,重 750 克,负载 200 克。适用于移动底盘及巡检设备,在有限空间内完成轻量操作。
  • A02:双节段、4 自由度,臂长 30 厘米,负载 400 克,最高速度 0.78 米/秒。适用于桌面操作、近人服务及狭窄空间作业。
  • A03:三节段、6+1 自由度,臂长 50 厘米,负载 600 克,最高速度 1.17 米/秒。具备更大的构型空间,可绕过障碍并完成复杂角度操作。

全系支持 ROS 1/2、Python 与 C++,部分型号配套 GUI 及仿真环境。对 Fi0 模型而言,这组产品提供了真实、连续且可验证的本体差异样本,使模型能系统性地学习身体变化如何影响任务执行方式。

Fi0:跨本体基础模型 Foundation Intelligence Across Embodiments

Fi0 是擎羽在基础智能(Foundation Intelligence)方向的首代成果,其核心理念是:机器人对任务和物理世界的理解应跨越身体复用,真正需随身体变化的仅是行动策略。

例如“将方块放入碗中”这一任务,无论机器人手臂长短或单双臂配置,其操作逻辑、对象关系及目标状态保持一致。Fi0 旨在让任务意图在不同身体间延续,并根据当前机器人的形态与动力学特征生成适配动作。此外,针对训练未覆盖的新任务,Fi0 支持通过人类示范(Demonstration)作为推理时的技能上下文(Skill Context),无需重新训练参数即可执行新技能。

Fi0 的上下文涵盖语言、视觉、人类示范、世界状态及本体信息,并建立了四大核心机制:

  • Skill Encoder:将人类示范转化为可调用的技能上下文。
  • Cross-view World Encoder:从不同视角学习共享的物理世界表示。
  • Embodiment Graph:将机器人结构与实时状态纳入模型。
  • World Dynamics Model 与 MAWA:预测并评估不同动作的未来后果。

从上下文中学习技能

面对真实世界中难以穷尽的任务长尾,Fi0 将新任务适配前置到推理阶段。当遇到未知技能时,人类可通过 Ego 头环提供一次示范,Fi0 将其编码为 Skill Context,理解操作对象、任务顺序及关键接触点,结合当前环境生成动作。这意味着新技能无需等待模型迭代更新,即可直接注入机器人执行流程,实现了基础模型能力与上下文学习的互补。

△ 面对陌生任务,Fi0 可以将一次人类示范作为技能上下文,在推理时理解任务,并结合当前视觉与本体信息,为不同机器人身体生成相适配的动作。

从不同视角学习同一个世界

人类示范通常源于第一视角,而机器人感知可能来自腕部、机身或外部相机。为解决视角差异带来的像素空间不一致,Fi0 引入 Cross-view World Encoder。该模块通过对齐人类与机器人视角的视觉编码,学习包含物体状态、空间关系及任务进程的共享世界表示。这使得模型能跨越相机位置差异,提取稳定的物理规律,让人类经验真正被不同构型的机器人复用。

△ Fi0 从人类的第一视角与腕部视角中,学习关于物体、交互、任务进程和未来动态的共享世界表示。

将人类示范转化为技能上下文

人类示范的价值不仅在于手部轨迹,更在于其背后的任务结构与交互逻辑。Fi0 通过 Skill Encoder 将示范编码为一组 Skill Tokens,描述对象变化、任务阶段及关键接触点,而非单纯复制运动轨迹。这种设计使得同一段人类示范能成为多种机器人的共同任务上下文:它们共享对技能的理解,再依据各自的长度、构型及驱动能力生成具体的执行动作。

△ Fi0 将人类示范转化为推理时的技能上下文,提取任务结构和交互逻辑,而不是复制与特定身体绑定的运动轨迹。

模型不仅要控制身体,还要理解身体

跨本体模型需深刻理解自身控制的躯体特性。Fi0 摒弃了简单的 Robot ID 切换策略,转而构建结构化的 Embodiment Graph,并通过 Graph Encoder 生成 Body Tokens。机器人的拓扑、节段、尺度、感知及动态状态均被纳入此表示,与语言、视觉等信息共同参与决策。

柔性机器人的连续形变特性进一步放大了这一需求。身体状态本身即为世界状态的一部分,模型需同时感知外部环境变化与自身形态改变。Fi0 在这一连续本体空间中,学会了区分哪些知识可跨身体共享,哪些动作需随身体调整,从而将能力边界延伸至更广泛的机器人结构。

△ Fi0 将机器人的形态、感知、驱动方式和动态状态表示为本体上下文,使共享技能能够转化为适合不同身体的动作。

不只是生成动作,还要预测动作的后果

针对柔性本体多解性的特点,Fi0 在执行前会生成一组候选动作方案,并利用 World Dynamics Model 推演各方案在未来时间步的状态变化。随后,多目标动作 - 世界评估模块(MAWA)综合任务进展、成功概率及物理风险进行评分,择优执行。

这一机制确保模型不仅停留在感知层,更能深入决策层。同一技能在不同长度的机械臂上可产生截然不同的最优路径:短臂倾向直接接近,长臂则利用冗余自由度避障。Fi0 通过预测与评估,实现了技能上下文、世界表示、本体条件与未来推演的完整闭环。

△ Fi0 在执行之前,预测并评估候选动作在当前本体条件下可能产生的未来结果。

迈向跨本体基础智能

Fi0 框架将任务、世界、身体与行动统一组织,使机器人经验得以跨越单一身体持续积累。模型复用的任务结构与物理知识,可在新本体上重新表达;而新本体的真实执行数据,又反过来丰富模型对动作后果的理解。柔性本体提供的连续变化验证空间,加速了这一过程。

这一能力不仅限于柔性机器人。在制造、医疗、太空等多元场景中,形态各异的机器人可共享同一套智能内核,仅根据各自身体特性调整执行方式。这正是"Foundation Intelligence Across Embodiments"的核心愿景:身体可变,但智能与世界理解持续积累。

下一场具身智能竞争,可能发生在身体之间

当人形机器人致力于寻找通用身体时,擎羽提出了更具产业深度的命题:如何让已有智能在不同身体间高效迁移。随着应用场景细分,机器人身体必将多样化,行业痛点将从“何种形态最通用”转向“如何降低新身体的适配成本”。

擎羽通过标准化柔性本体产品矩阵、持续积累真实世界数据,并利用 Fi0 模型统一任务、世界与本体,构建了任务、身体与物理世界间不断扩大的映射关系。这条路线旨在让通用智能逐渐摆脱对特定身体的依赖,确保每一副新身体都能继承此前对任务和世界的理解,从而实现具身智能的复利效应。

【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16363
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读364.6k
粉丝1
内容16.4k