大数跨境

机器人GPT-3时刻震动硅谷!0行代码,看一遍秒会,黄仁勋李飞飞参投

机器人GPT-3时刻震动硅谷!0行代码,看一遍秒会,黄仁勋李飞飞参投 新智元
2026-08-21
7
导读:只需一次 3-12 秒的演示,不训练、不微调,几秒钟学会。

新智元报道

8 月 19 日,宇树科技在科创板上市,开盘市值约 4449 亿元。同日,英伟达 CEO 黄仁勋之女现身北京 WRC 世界机器人大会。紧接着,硅谷机器人公司 Generalist AI 于北京时间凌晨发布新一代基础模型 GEN-1.5。

两个月前,斯坦福教授李飞飞、小米联合创始人林斌、Zoom 创始人袁征及英伟达共同完成了对 Generalist AI 的 4 亿美元融资。GEN-1.5 的发布揭示了资本涌入的逻辑:仅需观看一段 3 至 12 秒的动作演示,无需训练或微调,机器人即可当场执行任务,在 10 个操作任务中平均成功率达 59%。

过去工程师需耗时三月编程才能让机器人拧开瓶盖,如今仅需三段视频和零行代码。多位顶尖研究者将这一刻类比为 2020 年 GPT-3 的发布,认为具身智能正式迎来了自己的"GPT-3 时刻”。

没人教过的策略:从预训练中涌现

GEN-1.5 最震撼业界的能力并非模仿,而是即兴发挥。Generalist AI 的实验显示,仅用 5 分钟人类演示数据(仅做 1 个梯度步骤微调)教会机器人用刷子将积木扫入碗中后,更换工具时模型展现了惊人的泛化能力:

  • 面对香蕉,它利用形状相似性将其作为刷子横扫积木;
  • 面对簸箕,它放弃“扫”的策略,转而用手将积木推上簸箕并倾倒;
  • 当碗被纸覆盖,模型自发掀开纸张放入积木,甚至事后盖回;
  • 面对指尖粘连的乐高积木,模型主动用另一只手拨落;
  • 在未被教导的情况下,模型自发切换双手操作旋转罐盖,并按颜色分拣积木。

这些动作序列并未出现在训练数据中,Generalist AI 通过检索约 189 万段预训练场景也未找到类似用法。这是大规模预训练带来的涌现能力。

GEN-1.5 已连续预训练超过 8 个月,经历三个阶段。验证集曲线显示,模型的“下一步动作预测误差”持续下降且未见收敛迹象。这验证了具身智能的 Scaling Law(缩放定律):随着物理交互数据规模增大和训练时间延长,模型泛化能力持续增强。

研究还发现一个反直觉现象:微调的梯度步骤越少,即兴发挥能力越强。仅 10 个梯度步骤只改变了 0.15% 的参数,这更接近于“提醒模型已知的事情”,而非重新训练,从而保留了预训练积累的广泛物理经验。

此外,GEN-1.5 跨越了两道行业鸿沟:一是模拟器演示可直接迁移至真实机器人执行,并泛化至不同机械手和新物体位置;二是人类徒手演示可被机器人直接复现。这些能力均非刻意架构设计的结果,而是从大规模物理数据预训练中自行涌现。

「操作学习的圣杯」:Scaling 趋势清晰

尽管此前已有团队展示过类似的上下文学习能力,但多局限于少数任务。GEN-1.5 的新颖在于其广泛的覆盖面。虽然目前任务仍集中于拧瓶盖、拉拉链等短程操作,距离复杂长程任务尚有距离,但其发展轨迹与 2020 年的 GPT-3 高度相似:能力尚显粗糙,但方向明确,Scaling 趋势清晰。

Generalist AI 官方博客指出:“过了某个预训练阈值之后,适配一个新任务的成本变得可以忽略不计。涌现的上下文学习、几秒钟的数据或一个梯度步骤,已不再是传统意义上的任务特定训练,而是对模型已知知识的唤醒。”

如果具身智能的 Scaling 曲线确实未现收敛迹象,那么下一轮竞争的核心将是谁拥有足够的物理交互数据。这与 2021 年大语言模型进入数据争夺战的剧本如出一辙。

看一遍就能学会:59% 和 83% 背后的拐点

2020 年 GPT-3 通过 In-context Learning(上下文学习)实现了从专用工具到通用平台的跨越。GEN-1.5 将这一能力带入物理世界,称之为 Physical Prompting(物理提示)。

其操作逻辑是:将一段包含传感器数据和动作轨迹的真实演示塞进模型的 30 秒上下文窗口,模型即刻尝试执行,全程无训练步骤。这与传统需要数万步梯度下降的微调形成鲜明对比。

在 10 个不同操作任务(如开罐、拉拉链、取钱、叠纸等)的测试中,GEN-1.5 表现如下:

  • One-shot(零梯度步骤):平均成功率 59%;
  • Few-shot(5 分钟数据,10 个梯度步骤):平均成功率 83%。

这一数据结构与 2020 年 GPT-3 在语言任务上的表现(One-shot 约 45%,Few-shot 约 65%)高度相似。这意味着,教机器人新任务的时间成本已从数月压缩至数秒,使用者也从专家扩展至普通人。

机器人沸腾的一周:上市潮与大脑缺席的焦虑

GEN-1.5 发布的节点正值全球具身智能行业的高光时刻。8 月 19 日,WRC 世界机器人大会在北京开幕,300 余家企业亮相;8 月 22 日,第二届世界人形机器人运动会开赛,参赛队伍同比增长 138%,首次聚焦真实场景下的长程任务。

刚上市的宇树科技虽以 2025 年全球第一的出货量(5500 台)和 60% 的毛利率引人注目,但其招股书也暴露了隐忧:2026 年一季度营收增速大幅回落,净利润同比下降,核心原因是研发投入激增。宇树正在追赶其缺失的关键拼图——具身智能大模型。

正如分析文章《宇树科技的招股书里,藏着对工程奇迹“保质期”的焦虑》所指出的,宇树造出了全球领先的躯体,却面临“大脑缺席”的结构性困境。2026 年被称为具身智能“上市大年”,超 20 家公司计划上市,背后多是资金压力驱动。

宇树创始人王兴兴在 WRC 上坦言,具身智能大模型是主要瓶颈,预计机器人的"ChatGPT 时刻”将在未来两到十年内到来。GEN-1.5 的发布正是对这一判断的首次实证回应。

一旦通用大模型成熟,躯体厂商的价值将取决于接入大脑的速度,而非单纯的硬件参数。Generalist AI 的团队背景印证了这一技术路线的正确性:联合创始人 Pete Florence 和 Andy Zeng 来自谷歌 DeepMind,Andrew Barry 来自波士顿动力。公司继 2026 年 6 月完成 4 亿美元融资(估值 20 亿美元)后,正以 30 亿美元估值洽谈新一轮融资。

从左至右分别为:Pete Florence, Andrew Barry, Andy Zeng

硅谷大佬的集体沸腾与理性冷思考

GEN-1.5 的发布在机器人研究社区引发强烈反响。联合创始人 Pete Florence 感慨,近十年的想象终于走进现实,实现了他心中清晰的"One-shot 上下文学习”目标。

卡内基梅隆大学研究者 Chris Paxton 称其为“操作学习的圣杯”,东北大学 Jimmy Yang 则认定这是该领域真正特别的时刻。

英伟达机器人技术总监 Jim Fan 提供了深入的技术观察。他指出 GEN-1.5 涌现能力的两个关键:一是训练数据中自然存在的对称重复动作模式(如反复拧螺丝),构成了天然的上下文学习样本;二是数据中包含的人类失误后恢复动作(失败 - 恢复 - 继续),让模型自然习得纠错能力。此外,Generalist AI 采用的 UMI 数据采集方式(人直接佩戴夹爪操作)有效保留了人类的“物理直觉”。

当然,理性的声音依然存在。Jim Fan 在评论区提醒:“演示目前仍然有点太简单了,还不能下最终结论。”但这并不妨碍 GEN-1.5 成为具身智能发展历程中的重要里程碑。

参考资料:
https://generalistai.com/blog/gen-1.5

编辑:马可

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16481
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读350.8k
粉丝0
内容16.5k