作者|Li Yuan
编辑|靖宇
研究人员先教机器人用刷子将积木扫入碗中,随后撤去刷子换成香蕉。机器人竟抓起香蕉横贴桌面,模仿扫的动作将积木推入碗内。当工具再次换为簸箕时,机器人未再机械重复“扫”的动作,而是灵活伸出另一只手将积木推上簸箕,端起倒入碗中。
关键在于,研究人员从未在任务中教导其使用香蕉或簸箕,这些策略均为模型自主推理所得。
这正是 Generalist 最新发布的 GEN-1.5 具身基座模型所展现的能力:模型开始从大规模人类操作数据中天然存在的重复、失误与恢复过程中,学习到训练者未逐项教授的动作,显露出智能涌现的迹象。
更令研究者兴奋的是,GEN-1.5 展示了一项名为「Physical Prompting」(物理提示)的新能力。研究人员仅需手持简易夹爪演示一次 3 至 12 秒的操作,GEN-1.5 无需微调或更新任何参数,即可在新的物体位置和初始状态下尝试执行同一任务。
曾参与 Google DeepMind Gemini Robotics 的研究者 Ted Xiao 将这种“看一次示范即学会新任务”的能力称为机器人领域追寻多年的“圣杯”。在他看来,GEN-1.5 是这条路线上迄今最好的成果,那种能力突然跃升的感觉,令人想起第一次使用 GPT-3 时的震撼。
能够实现物理提示,说明 GEN-1.5 的基座模型已足够强大。短短几秒的示范无法从头教会机器人如何抓取和控制物体,更像是在提醒模型一件它几乎已经掌握的技能。
这一瞬间之所以动人,是因为它与过去动作缓慢、环境固定、稍遇变化便失败的机器人形成了鲜明反差。如今的机器人开始像大语言模型一样,面对新问题能自行组织出未曾被写入提示词的回答。
Generalist 有意将此变化与 GPT-3 相比。GPT-3 之前,语言模型仅偶尔表现出少样本学习能力;而 GPT-3 让这种现象在广泛任务上变得显著。只看一个例子,平均准确率约为 45%;看到约 100 个例子后,可达约 65%。
Generalist 虽不如 Figure 那样频繁出现在聚光灯下,但在机器人研究和产业圈备受瞩目。原因在于,它将过去两年的赌注全压在一个判断上:物理智能也可以 Scaling。
2025 年 11 月,Generalist 用 GEN-0 证明增加真实物理数据、模型规模和计算量可让下游任务共同进步;2026 年 4 月,数据规模超 50 万小时后,GEN-1 将若干简单任务的平均成功率从 64% 提升至 99%。
此次 Gen-1.5 的发布伴随着一个重大宣告:学习新任务所需的训练正在消失。模型参数调整过程从过去的数百次压缩至数十次、10 次、1 次,最终归零——模型不再需要重新训练,看一遍就能开始工作。
目前,GEN-1.5 仅看一次示范,在 10 项新任务上的平均成功率为 59%;若使用 5 分钟数据并调整 10 次参数,成功率可提升至 83%。虽然距离完全放心交付仍有差距,但它已处于一条清晰的 Scaling 曲线上,机器人的智能涌现近在咫尺。
01
机器人也可以有 Prompt 了
Generalist 展示了 GEN-1.5 学习和使用新能力的三种典型场景。
面对未知变化,直接切换策略
机器人学过将积木放入碗中,但未见过碗被纸盖住的情况,它会先移开纸张;当乐高卡在一只夹爪上,它会用另一只手取下;只学过单手开罐,有时也会灵活切换为双手操作。此处并未重新提供数据或训练模型,任务本身已学过,但变化未学过。GEN-1.5 展示了对新工具、新障碍和意外情况的直接泛化能力。
单次示范,即刻执行新任务
研究人员在机器人面前演示拉开拉链、拧开罐盖或从钱包抽纸币,时长仅 3 至 12 秒。GEN-1.5 不调整任何参数,随即在物体位置变化的情况下尝试执行。Generalist 将此称为「Physical Prompting」,类似于给大语言模型一段 Prompt:示范未被训练进模型,只是临时告知当前任务。在 10 项新任务上,这种单次提示的平均成功率为 59%。
物理提示还可组合。研究人员分别示范两个任务,GEN-1.5 能将其串联成一套连续动作,并自动补全调整位置、换手和重新抓取等细节。来自模拟器的动作也可提示现实中的机器人;部分实验中,人直接用双手示范,机器人随后也能尝试复现。
分钟级数据,快速稳固新技能
研究人员提供 1 到 5 分钟、约 10 到 50 次演示,再调整 1 到 10 次模型参数。使用约 5 分钟数据和 10 次调整时,10 项任务的平均成功率可从单次提示的 59% 提升至 83%。这仍是训练,但已从过去的数百次调整压缩至几次。
这三种情况指向同一结论:GEN-1.5 的基座模型已提前学会大量基础动作和物理规律。面对新变化可直接调用,看到一次示范可临时组合,获得几分钟数据又能迅速稳定。
按照 Generalist 的说明,GEN-1.5 同时处理视频、传感器数据、语言和机器人自身状态。示范被放入 30 秒的上下文窗口,其余空间持续加入最新画面;模型以 100Hz 输出动作轨迹,在执行中继续观察修正。
预训练数据仅从家庭、仓库和工厂活动中随机截取的连续片段。测试时突然插入一段外来动作,本是训练中未刻意安排的形式,模型却知道应接着执行。
关于能力成因,Generalist 尚无定论。一种猜测是人类工作中天然充满重复:拧完一颗螺丝通常还要拧下一颗。模型在海量连续动作中,可能已无数次练习了“看见前一个实例,延续下一个实例”。
另一线索来自失败。人会失手、调整、重新抓起物体然后继续工作。若这些不完美过程未在数据清洗时被剪掉,模型看到的就不是只有正确动作的轨迹,而是完整的“失误—修正—继续”。英伟达机器人研究负责人 Jim Fan 认为,这可能是 GEN-1.5 会恢复和换办法的重要原因。
02
Generalist 是谁?
此次 Generalist 未公布 GEN-1.5 的准确参数规模及完整训练配方,但从其一贯路线中可见端倪。
Generalist 成立于 2024 年,一年后正式走出隐身状态。三位联合创始人来自两条机器人技术主线:Pete Florence 和 Andy Zeng 曾在 Google DeepMind 从事机器人研究,参与过 PaLM-E、RT-2 等具身模型;Andrew Barry 曾是 Boston Dynamics 资深研究员。团队成员还包括来自 OpenAI、自动驾驶和机器人公司的专家。
在大众传播中,Generalist 知名度远不如不断发布人形机器人视频的 Figure。但在研究、创业和投资圈,它一直备受关注。投资人陈哲指出,Generalist 和 Sunday Robotics 对行业推动巨大,总能拿出此前少见、事后看来又很合理的设计。
这也解释了 Generalist 的公司形态:不打造明星人形机器人,而是训练一套可进入不同机械臂、夹爪和工具的底层智能。Figure 交付模型加完整人形身体;Generalist 关心的是同一种智能能否换一双手、换一台机器仍继续工作。
Generalist 过去两年的技术路线可概括为一词:Scaling。
2025 年 11 月发布 GEN-0 时,公司已积累超 27 万小时真实操作数据,每周增加约 1 万小时。实验发现数据并非越多越有用:10 亿参数模型很快遇到瓶颈;60 亿参数开始明显受益;70 亿参数以上,海量物理经验才更稳定转移至新任务。GEN-0 随后扩大至 100 亿参数以上。
Generalist 试图证明机器人存在类似大语言模型的规律:数据、模型和计算量同步增加,一组不同任务会共同进步,而非每项任务各自从头训练。测试显示,GEN-0 扩大预训练后,16 组新任务的动作预测误差同时下降,真实机器人成功率随之提高。
到 2026 年 4 月的 GEN-1,数据已超 50 万小时。使用约 1 小时机器人任务数据后,一组简单任务的平均成功率从 GEN-0 的 64% 提高到 99%,折盒和手机包装等任务速度也提高至此前三倍。
这套数据并非靠传统遥操作采集。传统方式要求人通过 VR 或手柄控制机器人,每增加一名采集者需增加昂贵设备。Generalist 采用接近 UMI 的路线:让人拿着带相机的“机器人手”直接在家庭、仓库和工厂干活,再将动作转换为可学习数据。
公司确认采用低成本手持设备和简易夹爪,称已在不同地区部署数千套采集硬件。训练系统一天可读取相当于 6.85 年的人类操作经验。
鹿明机器人联合 CTO 丁琰曾估算,即使完全照搬 Generalist 公开的采集方式,仅制造硬件需四到六个月;若要积累 27 万小时数据,至少需约 1000 人持续采集大半年甚至一年。他认为,对一个刚起步的团队,“半年到一年追上”过于乐观。
这种影响甚至改变了中国投资人对数据路线的判断。深度机智创始人陈凯提到,Generalist 用大规模人类操作数据展示模型能力,并以 27 万小时数据跑出清晰 Scaling 结果。原本被认为难以迁移到机器人的人类数据,开始成为资本愿意下注的技术路线。
Generalist 对模型本身也做了非主流选择。GEN-1 约 99% 的参数从头训练,不依附 Gemini、GPT 或其他读过互联网图文的模型。公司认为,当真实操作数据达几十万小时,模型可主要从物理经验中建立能力。
因此,Generalist 拒绝将模型简单称为 VLA 或 World Model。GEN-1.5 展示的方式更直接:看到当前画面和刚才的示范,持续决定下一步动作。其内部很可能形成了某种对物理世界的理解,只是未公开单独预测未来的模块。
GEN-1.5 与 GEN-1 几乎同时启动,连续预训练超八个月。随着训练推进,新任务所需参数调整从数百次降至零。即便调整 10 次,模型内部参数整体变化也不到 0.15%。用 Generalist 的话说,这不像从头学习,更像提醒模型一件它几乎已会的事。
今年 7 月,Generalist 还为 GEN-1 接入五指手、夹钳、电动螺丝刀、打蛋器等不同工具,以及约 9000 种标准夹爪改装形态。它想证明物理智能不必锁在人形机器人手上:夹爪、吸盘和专用工具均可成为模型与世界接触的方式。
资本已为这条路线给出高价。今年 6 月,Generalist 完成 4 亿美元融资,累计超 5 亿美元,估值达 20 亿美元。Radical Ventures 领投,英伟达、Bezos Expeditions 等参与。早期投资方 Boldstart 强调的不仅是某款机器人,更是 Generalist 的“数据手”及由此建立的数据循环。
03
机器人的 GPT-3 时刻?
九个月前,Generalist 发布 GEN-0,用 27 万小时真实世界操作数据证明机器人模型也可 Scaling。那次发布被业内称为机器人最接近"GPT-1 时刻”的尝试:重要的不是机器人已多聪明,而是数据、模型和计算量增加后,能力开始沿可预测曲线提高。
这一次,Generalist 将参照物直接换成了 GPT-3。
事实上,用更少演示适配新任务已是近期机器人基础模型共同追赶的方向。Generalist 真正显眼的是速度:2025 年 11 月 GEN-0 证明物理数据可 Scaling;五个月后 GEN-1 将简单任务成功率推至 99%;再过四个月,GEN-1.5 已将新任务所需数据压至几分钟、一次演示,最后不再更新参数。
这也是为何一次提示仅 59% 成功率仍引起关注。它不足以部署,却是 Scaling 曲线上新的现象:随着模型看到更多物理经验,新任务需要的专门训练从数百次参数调整一路降为零。
行业已开始围绕同一方向加速。Jim Fan 对 GEN-1.5 持“谨慎乐观”态度。他认为人类数据中的重复和错误恢复可能是关键,同时也提醒一次示范能否成立取决于新任务离预训练数据有多远。若测试里的物品与模型过去所见非常接近,“看一遍就会”与真正学会陌生工作仍有差距。
目前公开结果也留有未知:10 项任务较简单,平均成功率仅 59%;物理提示对复杂柔性物体、长时间任务和完全陌生场景是否有效尚无答案。所有核心数字均来自 Generalist 自身,公司未公布足以让外界完整复现 GEN-1.5 的论文、参数和训练细节。
但正确理解限制不等于忽略进展。GPT-3 刚出现时同样生成大量错误,它真正改变世界之处在于让人们相信同一个模型可通过 Prompt 临时学会许多不同任务。GEN-1.5 现在展示的,正是这个接口在物理世界里的早期形态。
过去,每增加一种机器人用途都要重新采集数据、训练模型、上机测试,再由工程师轮轮修正。机器人本身或许便宜,真正昂贵的是让它在新现场可靠地做一件新工作。
Physical Prompting 指向另一种可能:把任务留在眼前。机器人不必为每一项工作永久改变参数,使用者只需告诉它这一次要做什么。若此能力继续提高,被压缩的不仅是示教时间,还有为每个新任务准备数据、占用机器人和投入工程师的成本。
这不会消除安全验证、现场集成和硬件维护,也非今天就能兑现的部署方案。但它可能改变部署成本中最难下降的部分:每增加一种用途都要重新教一遍机器人的代价。
今天的机器人还远未学会一切。但让它继续变强、也让每一种新用途变得更便宜的那条 Scaling 曲线,已经开始显现。
*头图来源:Generalist

