具身智能领域当前喧嚣不已,行业声音繁杂,往往声量大者离真实进展最远。真正推动行业前行的,是那些践行非共识、拥有完整技术图谱的探索者。这些关键动态虽少上热搜,却决定行业未来走向。
欢迎来到极客公园 In The Loop,一同探寻行业深处的真实进展。
「这是 Figure AI 成立以来最重要的项目。」在 Helix 2.5 发布视频中,Figure AI 创始人 Brett Adcock 言辞笃定。
作为全球估值最高(390 亿美元)的未上市人形机器人公司,Figure AI 致力于让人形机器人完成日常任务。过往几代 Helix 虽能自主工作,如合作拉平被子或用臀部顶开洗碗机,但常被诟病仅能在光线良好的样板间中演示。
Helix 2.5 试图跨越这一局限。Figure AI 在旧金山湾区租用 30 套真实住宅,将机器人直接投入现场,执行整理客厅、铺床和折叠毛巾等任务。尽管视觉上仍似样板间,但 Figure AI 强调,团队未针对这些住宅和物品进行任何专项训练或适配,且在所有 30 套住宅中均取得了成功案例。
「Helix 2.5 要在一套从未进入过的房子里,折叠它从未见过的毛巾。」Brett 表示。这标志着机器人领域长期追逐的泛化能力初现端倪:机器人不再局限于重复实验室动作,而是能将积累的经验迁移至陌生环境。
然而,测试数据揭示了现实挑战。在 420 次测试中,成功 237 次,完整任务成功率为 56%。这一结果引发了同行罕见的尖锐批评:Sunday Robotics 联合创始人 Tony Zhao 指出近半数的失败率难以接受;Stealth CEO Nikolai Ensslen 则认为这恰恰证明模仿学习系统无法实现真正的泛化。Figure AI 自认摸到了机器人版 Scaling Law,而同行看到的却可能是一条走不通的路线。
向 Zero-shot 的圣杯迈进一步
Helix 2.5 的核心变革在于学习方式的升级。此前的 Helix 02 基于预训练的视觉语言模型,利用特定环境数据学习动作,导致换个场景需重新采集数据。而 Helix 2.5 从随机初始化开始,先在 Figure AI 的人类行为数据集 Index 上完成预训练,再针对整理玩具、折叠毛巾和铺床三种行为进行适配。
测试阶段,机器人被送入 30 套未曾采集过数据的住宅,使用固定版本模型完成任务,中途不进行微调。这便是 Figure AI 定义的 Zero-shot:并非仅凭自然语言指令自发创造方法,而是在未见过的住宅布局、物品材质及摆放位置下,复用已学技能。
家庭环境的非标准化是家用机器人落地的最大障碍。床的高度、毛巾材质、玩具位置乃至落脚空间在不同房屋中千差万别。若每次部署均需重新训练,产品化将无从谈起。
在每项任务 140 次的测试中,评判标准严苛:整理客厅需将所有玩具入篮,折叠毛巾需四条全部折好入篮,铺床需满足枕头位置及被面覆盖要求。任何人工干预或超时均记为失败。
最终数据显示:铺床成功率约 67%(94 次),折叠毛巾约 62%(87 次),整理玩具约 40%(56 次),综合成功率 56%。测试中,Helix 2.5 展现了全身纠错能力,如在操作位置不当时调整站姿或移动至床的另一侧,表明其具备在陌生布局中规划路径的能力,而非机械播放预设轨迹。
对照组实验显示,未经 Index 预训练的模型成功率仅约 9%,而 Helix 2.5 达到 56%。Figure AI 据此认为,人类行为预训练赋予了机器人跨场景迁移能力,并大胆预测随着数据量增加,机器人领域也将出现 Scaling Law。
Figure AI 的 Scaling Law 叙事
大语言模型的迷人之处在于其进步的可预测性:增加数据、参数和算力,性能便沿稳定曲线提升,使研发成为可持续投入的工程。相比之下,机器人数据昂贵且异构,能力提升常呈手工定制化特征,难以通过规模扩张实现质变。
Helix 2.5 技术博客首次明确宣称观测到「人类到机器人迁移 Scaling Law」。继 Generalist 公司提出类似概念后,Figure AI 正式加入这一叙事。
实验采用四组不同规模的 Index 数据集(1 倍至 8 倍),固定模型大小与下游任务数据。结果显示,数据量每翻一倍,动作预测误差持续下降。基于前三组数据预测的最大规模训练误差,与实际结果偏差仅为 0.54%。现实世界中,Index 预训练将任务成功率从 9% 大幅提升至 56%。
为支撑这一愿景,Figure AI 已与 Nscale 签署协议,承诺初始 35 亿美元算力,计划于 2027 年下半年部署,长期目标高达 10 万块英伟达 Vera Rubin GPU。同时,Index 数据集正以每秒约 35 分钟的速度持续收集人类经验。
Figure AI 的逻辑是:当前的 56% 失败率源于规模不足。若数据、模型和算力继续扩大,成功率有望像早期大语言模型一样持续增长。
同行质疑与技术路线之争
具身智能领域的氛围已不再是一团和气。Helix 2.5 发布后,业内批评迅速涌现。
Sunday Robotics 联合创始人 Tony Zhao 聚焦于可靠性问题。他指出:「有用的工作=泛化+可靠性。」在家庭场景中,机器人需面对易碎品、儿童及宠物,偶尔的成功不足以让用户放心让其独立工作。尽管 Sunday Robotics 此前发布的 ACT-2 在衣物折叠测试中达到了 99.1% 的成功率(注:测试粒度不同,不可直接对比),但 Tony 选择以可靠性为切入点,反映了双方在商用家用机器人市场的竞争态势。
Synapticon 前 CEO Nikolai Ensslen 则从技术路线层面发起挑战。他认为,真正的泛化意味着系统在异地不仅能工作,且能每次都用。Helix 2.5 高达 44% 的失败率证明模仿学习尚无法实现泛化。
这种严苛评价的背后,是 GPT-6 等新一代模型带来的预期改变。从业者开始期待机器人具备上下文理解、试错反思及语义理解等「智能涌现」能力,而非仅仅学习视觉与动作轨迹的对应关系。传统模型在未见场景中容易重复错误轨迹,缺乏自我修正的理解力。
在此背景下,Figure AI 的 56% 成功率显得微妙。支持者视其为大规模人类经验迁移的里程碑;批评者则认为这只是更大分布下的模仿,缺乏应对偏离场景的智能。
Figure AI 最新一轮融资超 10 亿美元,估值达 390 亿美元,并已量产超过 350 台 Figure 03。公司将巨额算力与数据赌注押在 Helix 路线上。若成功率能随规模扩大稳步提升至 80% 甚至 90%,Helix 2.5 将成为机器人预训练时代的起点;若停滞不前,则可能引发对整条模仿学习路线的根本性质疑。
*头图来源:Figure AI
本文为 In The Loop 原创文章,转载请联系作者

