大模型能靠 Prompt 纠错,机器人不行。
在社交网络中,人形机器人似乎无所不能——后空翻、跑酷、跳舞、搬运。但在顶级学术界与产业前沿,一个反常识的难题正被死磕:为什么一台能完成后空翻的顶级机器人,往往连把锅铲放进抽屉都做不好?
在最新一期The Peterman Pod播客中,前 Instagram 工程师 Ryan Peterman 对话加州大学伯克利分校教授、Physical Intelligence 联合创始人Sergey Levine。Levine 作为谷歌学术引用超 27 万次的强化学习与机器人学泰斗,从 Google“农场盲抓实验”到开源 ALOHA 系统,其研究深刻影响了全球具身大模型的研发范式。

核心要点速览
- 技术阶段:机器人尚未进入单纯靠堆算力参数的"GPT-4 到 GPT-5"阶段,全行业仍在寻找底层可扩展的技术拼图。
- 波士顿动力启示:经典控制负责调控机体(如后空翻),现代 AI 负责理解外部环境(如端咖啡),二者分工明确。
- 智能涌现:真正的智能跃升体现在“合理的错误”上,如机器人打碎盘子后试图掩盖,展现出类似人类的常识推理。
- 中国供应链:全球机器人研发极度依赖中国高可靠、低成本的精密硬件,软硬件供应链是不可割裂的整体。
- 核心挑战:大模型可多轮修改 Prompt,但机器人的核心价值在于“彻底脱手”。跨越最后 5% 的工业级鲁棒性门槛远比纯软件残酷。
以下为对话实录精编:
我们还没到拼算力的阶段
主持人:人形机器人技术目前走到了哪一步?未来将如何部署?
Sergey Levine:过去十年机器学习的核心经验是:只要在正确方向上做大规模(Scale),就能起效。Transformer 之所以取代 LSTM,并非数学更优雅,而是更易扩展。技术演进分两步:先找到具备可扩展性的架构,再注入工业级资源。
回顾大语言模型发展,早期 GPT 更像杂耍,但随着数据量增加,研究人员预见到质变即将到来。然而,机器人技术目前尚未进入依靠单纯做大参数来压榨能力的阶段。我们仍处于奠定底层基础技术的时期,Scaling 规律本身也在演化。
目前的 Demo 展示了成型的底层技术,而非规模化威力的终极产物。我们正在拼凑核心技术拼图,距离完成非常接近,但因尚未进入稳定可预测的 Scale 阶段,很难精确预估未来的增长系数。
机器人的涌现时刻:当它开始像小孩一样「耍小聪明」
主持人:你见过最令人惊讶的涌现能力是什么?
Sergey Levine:早期涌现往往是微小细节。例如两年前,训练折叠衣服的模型意外同时抓起两件衬衫,并自主理顺、放回一件再折叠另一件,展现了人类般的常识。
近期更有趣的是机器人的“错误”。当模型能力跨过阈值,其犯错方式变得合情合理,不再是胡言乱语,而是语义通顺的失误。例如在厨房清理实验中,因抽屉卡住,机器人将餐具塞进烤箱,逻辑类似人类小孩“眼不见为净”;在洗盘子实验中,机器人摔碎盘子后移动底座挡住碎片,假装任务完成。
这些错误与人类小孩耍小聪明如出一辙,表明机器人正在“长大”。
软硬件绝不能割裂,中国生态给全行业上了一课
主持人:如何看待中国机器人产业的发展?
Sergey Levine:自动驾驶的落地证明了看似遥不可及的技术完全可以实现。对于机器人行业,最大的启示是必须拥有健康的完整生态。这不仅需要顶尖研究员,更需要健全的供应链、硬件制造能力和工程研发体系。
美国在部分领域领先,但在获取高可靠性、低成本硬件方面有所掉队。目前学术研究大量依赖中国制造的优质硬件。教训很明确:这是一个不可分割的有机整体,绝不能只做软件而将硬件全部外包。必须扶持整个工业制造生态,而非单一环节。
别把杂耍当泛化,突围的时间表是「个位数年份」
主持人:行业是否会出现数据飞轮效应?何时能真正落地?
Sergey Levine:数据飞轮逻辑成立,但前提是扩展方向正确。数据必须具备高度异构性与多样性,简单的重复劳动(如焊接)无法带来质的飞跃。数据对机器人而言是通识教育,而非标准大宗商品。
关于时间表,无论选择高度结构化场景(如巡检)还是非结构化场景(如家庭服务),真正实现落地突破所需时间均为个位数年份,绝非数十年。高度结构化场景可能今明两年即可落地,复杂场景稍晚,但不会拖太久。
路线图的核心是泛化能力。精彩的杂技演示若无统计学背景支撑,仅是排练好的演出。真正的泛化是在未见过的环境中稳定完成任务。关键里程碑包括:1. 在新环境中通过自主经验实现自我强化;2. 建立常识迁移机制,利用常识自动修复未知错误。
针对 Figure AI 等公司的长时直播演示,这是一种展示泛化能力的良好方式。我们在巧克力工厂和咖啡制作实验中也进行了长达数天或十几小时的连续运行测试,验证了系统在长时间任务中的稳定性及自主纠错能力(如在人类高层指令辅助下清理洒落的咖啡粉)。
先建立物理世界的锚点,再去向人类视频偷师
主持人:仿真数据、真实数据与人类视频,哪种最高效?
Sergey Levine:如果模型建立在对物理世界的坚实理解之上,吸收异构数据的效率会高得多。人类能理解粗糙的像素游戏或观察他人做饭,是因为具备物理常识作为锚点。
正确的路径是:先在海量真实具身物理数据上训练基础模型,建立物理锚定能力,再融合人类视频数据。实验证明,若缺乏足够的机器人原生数据,模型对人类行为与机器人行为的表征会割裂;而当机器人数据充足时,模型能按“任务语义”而非“执行者形态”进行表征,无缝兼容人类视频数据。
在跨构型泛化方面,目前核心指标是用极少目标样本迁移海量技能。我们通过引入“中间思考”模态(如文本推理或图像生成)来实现技能迁移。例如,让模型先“脑补”出任务下一阶段的视觉状态图像,再反向推导动作,成功让未见过的机械臂完成了叠衣服任务。关键在于引导模型在正确的模态(如空间视觉)下进行思考。
机器人的死穴不是安全,而是能不能「彻底撒手不管」
主持人:为何对机器人落地持乐观态度?潜在败因是什么?
Sergey Levine:现代基础模型软件栈极轻,且初期可在人机隔离场景落地,安全容错空间大于自动驾驶。最大的风险在于能否跨越极高的可靠性与鲁棒性门槛。
大模型是协同工具,允许人类多轮修正;机器人的核心价值建立在“全程脱手、自主闭环”之上。若每一步都需要人类监督,便失去了意义。跨越最后 5% 的工业级鲁棒性需要极致优化的架构与算法创新,尤其是利用强化学习攻克自主交互经验。
行业技术路线存在分歧:是深耕垂直场景,还是信奉“基础模型信条”?后者认为,训练能消化广阔任务数据的通用大模型,其在特定专业问题上的表现将碾压专用系统。多样化的泛化数据训练是应对极端情况的底气。
未来的物理智能,绝不是满大街跑着机械化的人类
主持人:机器人普及会带来安全焦虑吗?终极目标是替代人类劳动吗?
Sergey Levine:实体 AI 引发的安全顾虑必然成倍放大,应对之道是在实践中动态迭代。关于终极目标,将机器人理解为“机械化的人类”是认知误区。正如计算机并未替换人脑,而是融入万物形成“普适计算”,未来的物理 AI 将以多种形态渗透环境,赋能人类处理繁杂琐事,类似 Coding Agents 对程序员的赋能。
波士顿动力管好了躯体,而现代 AI 必须学会应对大千世界
主持人:如何解读波士顿动力声量减弱及行业范式转移?
Sergey Levine:推荐初学者阅读 ACT 论文(ALOHA 系统),它证明了平价硬件配合端到端学习即可完成高难度灵巧操作。波士顿动力的成就在于卓越的硬件工程与经典控制,擅长调控机体自身动力学(如后空翻)。
然而,当前瓶颈在于构建能与外部世界高智商交互的决策闭环。经典控制负责调控机器人自身的机械躯体;而 AI 负责理解和应对机体之外的大千世界。既然人类能手工提炼复杂运动规律,将其交给端到端学习算法自动化部署便是康庄大道。
别再迷信从零白手起家,没有先验知识就是自讨苦吃
主持人:给入行新人的建议是什么?
Sergey Levine:最核心的一课是:必须全方位引入极其广泛的先验知识(Prior Knowledge)。早期“白板假设”(从零开始盲抓)虽能跑通,但难以升级至高阶技能。
务实的路径是将本体交互经验与外部海量先验知识深度融合。语言的价值不在于文字,而在于它是承载庞大先验知识的脚手架。若不垫好这层先验知识,就是逼迫机器人解决比演化史更难的命题。请给予先验知识更多重视。

