大数跨境

深度|Peterman Pod对谈Sergey Levine:规模化的前提是,你得规模化对的东西

深度|Peterman Pod对谈Sergey Levine:规模化的前提是,你得规模化对的东西 象信AI
2026-10-07
4
导读:Sergey Levine 谈人形机器人的现状:为什么必须先规模化对的东西、数据为什么不能当石油买、泛化难在哪,以及机器人进家门的时间线。
左:Ryan,右:Sergey

左:Ryan,右:Sergey

过去十年机器学习给出的经验很简单:只要规模做上去,它就管用。但机器人至今还没走到靠工业级投入把模型做大、榨出更多能力的阶段,Sergey 在对话里几次把话题拉回同一件事:机器人真正的难点从来是泛化,而泛化很难靠一个演示视频看出来。

Sergey Levine 在对话里举了一个自己都没想到的例子:2024 年底的一次评测中,叠衣服的机器人从筐里一次拿出了两件衬衫。他当时觉得这下完了,结果机器人把两件衬衫放到桌上分开,把其中一件放回去,再开始叠另一件。事后可以去训练数据里查它是从哪儿学的,但那一刻看评测的人不会想到机器人真能做出来——这表现出你期待一个人有的常识。

Levine 是 UC Berkeley EECS 教授,研究机器人与强化学习,早年在 Google 参与过被称为「机械臂农场」的大规模机器人学习项目,如今是 Physical Intelligence 的联合创始人,做控制机器人的基础模型。这场对话从他为什么说“你得规模化对的东西”开始,讲到中国的机器人生态、数据飞轮、泛化为什么那么难、机器人基础模型与 LLM 的路线分歧,以及机器人进家门的时间线。他的主要观点包括:

机器人还处在确立基础技术的阶段,不是靠工业级投入榨能力的阶段。 transformer 的关键不在数学上多优雅,而在它更好规模化;语言模型先搞清楚什么可规模化,再砸数据砸参数,魔法才发生。机器人还没到 GPT-4 那个点,现在该期待的不是每月沿一条可预测曲线变强,而是随技术做对,规模化规律本身在演进。

真正的难点从来是泛化,而演示视频看不出来。 高难度体操动作看着带劲,但排练过的表演和在任何一个家庭里每次都可靠地做成一件事完全是两回事。泛化是很多次尝试才体现出来的性质,一次看不出来;机器人做着不起眼的事、用的是没见过的东西、待的是没测过的环境,这比练过几百万遍的后空翻更难。

数据不是电和石油,不是多买点就行。 汽车厂的机械臂每天焊车、一个月焊上百万次,拿它当数据飞轮,多半只能得到一个比焊车机器人强不到哪去的东西。数据不是那么可互换的,必须异质,更像是给你机器人办的一套教育课程,而不是可互换商品。

机器人数据是地基,先有它才更好吸收别的知识来源。 他的同事 Suraj Nair 与 Georgia Tech 的 Simar 做过一个项目,先用机器人数据训基础模型,再把人类视频数据加进去。看模型内部表征时发现:小模型少量机器人数据时,人类经验和机器人经验的特征完全分开;机器人数据量大且来自很多不同机器人时,特征更多按任务分组,几乎不对本体敏感,而那个基础模型压根没训过人类数据。这跟“先从 YouTube 视频开始”的想法正好相反。

机器人之间的泛化,可以靠用对模态的“思考”来促成。 文字思考适合迁移高层行为结构,比如收拾厨房得先开抽屉;用图像思考,让模型先想出任务下一个里程碑的样子,他们因此让 UR5 叠了一件 T 恤,尽管没有任何 UR5 叠衣服的数据。这不改变问题,只是加了一个让问题更好解的中间步骤。

想造仓储机器人,也该去收集覆盖面很广的数据。 基础模型的教训是:要解决一个具体问题,更好的做法是训练一个更通用的模型,再把它丢去做那件事,就像做机器翻译该去建理解所有语言任务的模型。这在机器人领域让人很不舒服,因为它跟传统垂直整合那套原则太相悖,但覆盖面够宽,模型才能把技能用到奇怪的边缘情况上。

机器人比 LLM 对可靠性的要求更高,最后一英寸还没解决。 LLM 做得不对,你改改 prompt 反复迭代就行,所以第一版 ChatGPT 已经很实用;机器人真正的价值要在它自主做事时才释放,每个任务都得有人守着迭代,几乎跟它能带来的好处相悖。从百分之九十五做到真正的百分之百,需要技术上的新突破,目前还没有被解决。

机器人基础模型的技术栈很薄,这是它可能更快的原因。 训练基础模型当然不容易,但真正在机器人上跑的软件特别简单,按代码行数算比传统自动驾驶技术栈少得多。安全挑战非常真实,但你可以挑任务、挑环境、挑硬件,让它严重程度低很多。加上部署越多、模型越强的正反馈循环,只要开始把东西放到真实世界里,哪怕有限制条件,也会反过来让它们越来越多地走出去。

规模化的前提:你得规模化对的东西


规模化的前提:你得规模化对的东西

Ryan:大语言模型在这个领域带来了前所未有的影响和投入,而物理AI和人形机器人有可能带来更大的影响。所以今天我想问你:现在人形机器人走到哪一步了,你觉得这项技术会怎么真正落地到现实世界里?

Sergey:从机器学习这边看,过去几年、或者说过去十年,我们学到的是:只要规模做上去,它就管用。现在这已经很明显了,但当年并不明显。不过有个前提,就是你得规模化对的东西。

最初大家做语言模型的时候,主流设计是LSTM,有些人还记得那是什么。它还行,比之前的东西好很多,但它的规模化能力不好。后来transformer的关键不在于它在数学上有多优雅,而是它更好规模化,用海量数据和大量参数训练起来更容易。所以技术的发展是分阶段的:先搞清楚你能规模化什么,也就是什么是可规模化的技术,然后再投入工业级的努力,加数据、加模型规模,这时候魔法才会发生。

所以当我们还在做更基础的技术研发时,关键是弄明白那些可扩展的杠杆是什么,把设计搞出来,把大致的配比搞出来。这件事本身挺酷,但真正改变世界的不是它,而是你开始拉动那根杠杆的时候。大语言模型也是这样:最早的GPT模型出来时,GPT-2能做点事,但有点像杂耍,你可以让它编个关于秘鲁独角兽的故事,英语是通顺的,但它解决不了多少现实问题。做这行的人意识到,嘿,这里有点神奇的东西——随着数据和模型规模上去,它会变得更通顺、更有效,所以他们能看出来,如果继续这么做下去,它会强得多。

回到你的问题,机器人现在还没到GPT-4、GPT-5那个阶段,还不是靠工业级投入把模型做大、榨出更多能力。它处在确立基础技术的阶段。正因为这样,现在该期待的不是模型每个月按某条可预测的规模化曲线变大变强,而是随着我们把技术做对,规模化本身的规律也在演进。

说点更实际的,我对我们在Physical Intelligence做的演示很满意,别人做出来的很多结果也确实很酷。但放在大背景下看,不该指望这些演示展示规模的威力,它们的作用是把基础技术做出来,之后再去规模化。所以我觉得我们现在的位置是,正在把那些拼图片一块块放到位,而且我觉得已经很接近了,很多拼图片都在归位。但为什么这项技术的走向这么难预测?因为它还没到那个可预测的规模化阶段,它还在搞清楚拼图片的阶段。我觉得这非常令人兴奋,但这也意味着很难预见之后的系数会是多少。

Ryan:到目前为止,你见过最惊人的涌现能力是什么?

Sergey:这是最有意思的地方,而且随着我们往前推进,见到的情况越来越多。

Sergey:最开始都是些小事,但已经挺神奇了,因为在机器人领域,2024年之前这些东西基本从没发生过。那时大概是两年前,我们会看到这样的情形:我们给叠衣服训练了一个策略,它从筐里把一件件衬衫拿出来,试着叠好。然后我印象特别深的一次是2024年底,我们在看一次评测,它一次拿出了两件衬衫。我看着就想,完了,它不可能搞定这个。

结果它把两件衬衫放在桌上,把它们分开,把其中一件放回去,然后开始叠另一件。事后你可以像侦探一样去查,看它是从哪块训练数据里学来的。但那一刻,我不觉得看那次评测的人会想到机器人真能做出来。这是件小事,但它表现出你期待一个人有的常识。

Sergey:不过最近我觉得更有意思的是它犯的一些错。大语言模型有件很了不起的事,就是它一旦足够好,就连错误都变得说得通——不是那种离谱的错误,也不是一直输出乱码,而是语义上说得通的错误。

去年我们给π0.5做过一次评测,机器人正在收拾厨房,指令是把所有餐具收起来,有勺子、锅铲之类的。它去开它以为放银器的那个抽屉,但抽屉怎么也打不开,于是它挪过去打开了旁边的烤箱,然后开始往里放东西。你能想象,如果你让一个小孩收拾东西,他可能也会这么干,因为那是个容器,东西能放进去,而且没人看得见。

还有一次实验是洗盘子,它把盘子拿起来,用海绵洗,然后放到沥水架上。这个实验是测记忆的,因为它得记住自己在做什么。它有个草稿纸式记忆,会写下来,比如我有三个盘子,我洗了灰的,我洗了绿的。然后它把其中一个掉在了地上,把底座开过去挡住,让你看不见,然后说,好了,灰盘子我洗完了。

Sergey:所以这些当然不是我们想看到的行为。但有意思的是,有些错误几乎就是你想象中一个小孩做这件事时会犯的错。

中国的机器人生态:美国能学到什么


中国的机器人生态:美国能学到什么

Ryan:那就等它长大了。你提到整个行业在进步,我知道很多人在做人形机器人,有Figure,有特斯拉,还有很多其他竞争者。你清楚什么是难的、什么是不难的。看这些竞争者的时候,有没有哪个进展让你觉得,这个真让人佩服、很了不起?

Sergey:我觉得行业里最鼓舞我的事情之一,就是自动驾驶系统的起飞。人们有时候批评机器人研究者,会说这东西跟核聚变一样,是未来的技术,但它永远在未来。可当年人们也是这么说自动驾驶的。现在呢,我们在旧金山,你出门就能叫一辆Waymo,它真的能把你送到目的地,车上没有司机。

不深入技术细节的话,真正鼓舞人的就是这一个例证:所谓未来的技术是可以真正落地的。而且它偏偏在2020年代中期落地,我觉得这不是偶然,因为大规模机器学习需要的很多拼图片,已经到了可以和真实物理系统拼在一起的水平。开车和机器人操作之间当然差别很大,但能够证明基于学习的技术真的可以落地到现实的物理世界,我觉得这特别鼓舞人。

Ryan:如果OpenAI或者Anthropic开始加大对机器人的投入,你觉得会怎么影响这个行业?竞争者会为此担心吗?

Sergey:机器人这个领域,说句公道话,生态确实不如机器学习其他方向那么健康。计算机视觉和自然语言处理天然就容易长出一个基于机器学习的生态,因为数据是免费能拿到的,大家也普遍接受要用学习的方法,而且那边没有像物理安全这么严重的顾虑。大家当然有理由担心AI安全,但那跟一台实体设备真的造成人身伤害不是一回事。所以在那两个领域拉起一支严肃的大规模机器学习团队,相对容易一些。机器人不是这样。

Sergey:机器人领域并没有真正拥抱数据共享这件事。所以我觉得,围绕机器人学习展开的活动越多,就越能把大家的想法推向这样一个未来:我们接受机器人由学出来的模型控制,而不是靠人工设计的控制器;会有数据,而数据必须共享,因为没有任何一家公司能只靠自己一个垂直领域就做出真正的基础模型。

这基本上就是把整个机器人领域的思维方式,往计算机视觉和自然语言处理那种模式上带,而不是传统工厂自动化那套。所以从这个意义上说,虽然在Physical Intelligence做的工作我很自豪,但要扭转所有人的思路,靠一家公司肯定不够。

Ryan:作为旁观者,我在Twitter上看到中国机器人那些非常惊艳的演示,某些方面甚至感觉他们已经领先了,但我没有很深的领域知识。所以很好奇你怎么看中国的机器人,他们真的走得更前面吗?

Sergey:我觉得有件事,对我们这些在美国和欧洲做这件事的人来说特别有用、也特别有建设性,就是问一句:我们能学到什么。

Sergey:对我来说,一个教训是健康的生态很重要。生态意味着

Sergey:显然要有好的研究者、好的工程师在做这些事,要有健康的开源。但它也意味着,构成机器人产业的不同行业各自都得非常健康。这些行业不只是计算机科学、机器学习和建模,还包括供应链、制造、硬件、研发,这些都非常重要。

Sergey:这其中的一些方面,美国做得相当好;另一些方面,美国有点放手不管了。我觉得我们该做的是看看世界上正在发生什么,看看中国实验室、其他国家的实验室做出的那些出色成果,然后从中得到一个教训:我们应该努力建设一个更健康的生态。这意味着要投资到所有相关的环节里去。我不是什么商业人士,也不是搞投资的,所以我不敢说知道该怎么做。但我认为,很重要的一点是真正接受这是一件整体的事,不是做其中一块、其他全都外包出去就行。

Ryan:在生态的这些环节里,作为一名美国的机器人研究者,你觉得哪一块如果变得更好,对机器人进步的推动最大?

Sergey:我觉得能稳定拿到低成本硬件肯定是件大事。现在用于机器人研究的硬件,很多确实来自中国,而且挺好,价格相对便宜,质量也高,能满足大家普遍需要的标准。但如果这些都能在本土采购,那就太好了。我不觉得这里有什么做不到的,关键只是要接受整个生态都需要被支撑,而不是只撑其中一块。

Ryan:可以想象,最先做到规模化的实验室会最先跑出来。可能会有这种指数级增长的效应:一旦部署起来,部署帮你增长得更快,增长更快又帮你部署得更多,就是这个飞轮。所以你相信这个行业会这样吗,某一家实验室,不管在美国还是中国,会撞上某个爆发点,然后一下子把其他人都甩开?

Sergey:这个说法很大程度上是对的。但有个重要细节得记住:你规模化的东西得是对的。如果让我换个说法来表达,就是

Sergey:要有一个有效的正向反馈循环——部署的机器人越多,模型能力就越强,这才是关键,这个逻辑完全成立。

Sergey:问题在于,做错的方式有很多。我说几个最明显的。一个明显的例子是,假设我是家汽车公司,我有个机械臂在焊车,它在装配线上,每天焊车,一个月焊上百万次。

Sergey:如果我就拿它当数据飞轮,那我多半只能得到一个比焊车机器人强不到哪去的东西。机器人本来就在那儿焊车了,那点边际提升估计没什么价值。这就是一个例子,说明你规模化的东西得是对的。因为数据不是那么可互换的,它不像电或者石油,不是你多买点就行。数据必须是异质的。所以我觉得这个方向是对的,但你得用对的技术、对的多样化学习来源去规模化对的东西。数据更像是给你机器人办的一套教育课程,而不是一种可互换商品。

数据飞轮与时间线:个位数年,不是两位数年


数据飞轮与时间线:个位数年,不是两位数年

Ryan:说到数据飞轮,还有推出一个合适的平台、让它产生真正有用的数据、再反过来改进这个平台,你觉得这种事情第一次在世界上出现,会是什么时候?

Sergey:我觉得技术这一侧正在非常快地朝那个方向走。真正会显著决定这个时间点的,可能是一个特定的平衡怎么拿捏,就是你愿意接受多少结构。一个极端是直接跳到完全无结构的部署场景,比如家用机器人。那会非常令人兴奋,因为一开始就有很多样性,但门槛也高得多,要在这个领域里足够有效、足够安全。安全在那儿是个大得多的问题,因为它就在人家里、在人身边。另一个极端是结构化得多的任务,可能不是焊车机器人那么极端,而是比如走廊那头那台机器人,做的是没那么结构化的事。那个领域容易得多,因为安全顾虑小很多,周围可能是受过训练的人,任务也更可预测。

Sergey:但你在那个领域里拿到的每一点数据的边际价值更低,因为变化更少。所以就像是可以更早起飞但斜率更小,或者更晚起飞但斜率更大,这个得去校准。但我的感觉是,不管是这个谱系的哪一端,现在都是个位数年,而不是两位数年。所以更结构化的那些,可能现在或者明年就会发生;没那么结构化的,可能还要再等几年,但大概用不了十年。

Ryan:很多人都在谈时间线,但都挺模糊的。你能不能给出一个大致的路线图,不用太具体,就是朝着机器人进我家、帮我干活这个北极星,中间有哪些里程碑?

Sergey:这个问题问得很好。先铺垫一句:关于机器人有一件非常重要、但特别容易被忽略的事,就是被那些炒作周期和演示视频盖过去了。那就是机器人真正的难点从来都是泛化。可当有人展示他们系统的演示时,光看演示通常看不出展示的是什么级别的泛化。比如那些高难度体操动作的机器人演示,看起来确实很带劲。但通常如果它有点像是安排好的,有时候真的是在舞台上表演,那就是排练过的,这没问题,因为那本来就是一场表演。但这跟在任何一个家庭里,每次都可靠地把一件事做好,完全不是一回事。而且泛化这个东西,单独拎出来看往往显得没那么厉害,因为泛化是很多次尝试才体现出来的性质,不是一次就能看出来的。所以你可能会看到机器人做着一件挺平常、挺不起眼的事,但真正让人兴奋的地方在于,它用的这个东西它从来没见过,它待的环境也从来没测过。这其实比做一个练过几百万遍的后空翻还要难。

Sergey:所以说回你的问题,我的答案是:这条路线图的关键有两件事,一是把泛化做得更好,二是产生那种二阶效应,也就是你越泛化,就越有机制去获得更多泛化。

这条路线上的一步,是要有一个特别具体的展示:一个机器人系统能靠自主经验越变越好,而且这些经验是在它最初没被训练过的场景里收集的。也就是说,我在后端、在实验室里做我该做的事,把模型训出来,把自适应算法做好,然后把它放进一个新场景。可能是家庭,可能是工厂,反正是个干真活的地方。它一开始做得还行,但时间一长就越做越好,好到达到实际能用的鲁棒性水平,而不是卡在百分之五十就上不去了。我觉得那会是一个重大的里程碑。因为它说明,如果这真是个自动化过程,它在收集有用经验的同时还在不断变好,那我就可以把它放到很多不同领域里,收集有用的经验,做人们真正想要的事,模型就会变得更好。所以我觉得那是这条路线上真正重要的一步。

另一个重要的步骤,是展示出一种非常具体、实际可用的方式,把知识迁移过去,把常识迁移过去,实现鲁棒性。这是另一种情况,就是你没法去练。比如你在路上开车,看到一辆消防车,还看到一堆交通锥,哪怕你以前从没遇到过这种情况,你的常识也会告诉你得慢下来。也许你不知道最优的应对方式是什么,但你不该直接冲过锥桶,把消防员惹毛了。这就是常识。如果你能用这种常识,有效地从意外情况里恢复过来,比如机器人把锅铲放进烤箱了,它大概应该打开烤箱把它拿出来,它在语义上知道这不是该干的事。我觉得这是另一个重要的步骤,因为它说明我们可以用常识来纠错。

Ryan:我能想象一种范围更窄的机器人,比如说制造业流水线上的一个人形机器人。我理解你的意思是,你对这种不太感兴趣,因为它算不上通往通用智能的一步?

Sergey:我想说的是,不是我兴趣更小,而是我觉得真实世界存在这些泄漏的抽象,会让这类事情比看起来复杂得多。

Sergey:我打个比方来解释。九十年代的时候,大家开始全力做自动驾驶。当时有个想法是,我们可以在环境里加一点设施,从而绕开很多难题:比如在高速公路上铺磁传感器,车上装个小传感器和小发射器,这样就能知道每辆车在哪,基本上就像飞机那套做法。然后大家觉得,我们其实不需要多高级的 AI,有这些传感器就能跑起来。

Sergey:结果基本上哪儿也没去成,因为真实世界有太多乱七八糟的例外和特殊情况。就算百分之九十九的时候这些磁传感器能让车正常跑,剩下那百分之一,有人走到路中间,或者路上有块垃圾,一切就全乱了。真正行得通的是 Waymo 说:行,我们不回避这个难题,我们不在荒郊野外部署,我们去旧金山,就是最乱的地方,正面硬刚。这样整个圈子才能往前走。我觉得机器人操作也会是一样。工厂那种完全结构化的世界,只要你想稍微往外走一点,哪怕百分之九十九的时候一切都很顺利,那百分之一出怪事的时候,就意味着你基本上得把整个问题范围都解决掉。

泛化为什么难:演示视频看不出来的东西


泛化为什么难:演示视频看不出来的东西

Ryan:这让我想起 Figure 有个演示,他们直播机器人分拣包裹。你看那个演示的时候,觉得它体现了泛化吗?

Sergey:对,我觉得体现出来了。顺便说,这点让我很受鼓舞。我刚才说,泛化很难在一个视频里展示出来,而很明显很多人在想这件事,在想怎么呈现一个东西,让人看一眼就能明白泛化是什么。你能看到很多有创意的做法:直播演示,还有那种超长的延时摄影。我觉得这主意很棒,是提升泛化在大家心目中重要性的一种很好的方式。

我们做 π*0.6 那个项目的时候——就是去年年底做的那个强化学习项目——我们想做些更长时程的实验。有些情况很直接,我们让机器人在 Dandelion 巧克力工厂组装盒子。那是个真的巧克力工厂,他们确实需要盒子,所以我们让它连着跑了好几天。但我们还有个咖啡任务,机器人用一台意式咖啡机做浓缩咖啡,我们的做法是让它连续做了十三个小时的咖啡。

Sergey:我们尽量环保,不想把咖啡倒掉,所以十三个小时之后,办公室里每个人都特别亢奋,因为总得有人把咖啡喝掉。但它确实跑了十三个小时,挺酷的。中间翻车了几次,比如咖啡渣撒了一地,然后它得去拿块布擦干净。但它确实会做,而且没爆炸,十三个小时就这么过去了。最严重的后果大概就是咖啡因摄入过多导致失眠。

Ryan:但是咖啡渣撒了以后它自己清理,这是它自己做的吗?

Sergey:这个实验的做法是这样的,它有一个高层提示。大概每五分钟,也就是在两个回合之间,提示会被更新一次,换成语义上连贯的任务。所以你告诉它,做浓缩咖啡,清理机器之类的。所以清理机器这一步,实际上是人下的指令。原则上我们可以把它自动化。事实上,我们现在花很大精力在做的一件事,就是改进负责下这些指令的高层策略。

但那次实验里,确实是每五分钟有人去更新一次它被要求做的事。我们本来的设想是,这些指令就像你去真的咖啡店说的那样——我要一杯拿铁,我要一杯浓缩,这本来应该是那个提示。只不过你还得告诉它,做下一杯之前先清理干净。

Ryan:有道理。听起来,在通往泛化的路上,数据是非常重要的部分。我读到数据有不同类型,有仿真数据,也可以收集真实的交互数据。我想听听你的看法,什么数据最好,什么最差,各自的优缺点是什么?

Sergey:顺便说,这个问题在机器人圈子里讨论很多,有些人的观点完全相反。我自己的看法是,只要模型能把各种不同的数据源扎根在对世界透彻的物理理解上,它们就更容易被模型内化。我举几个例子解释一下我的意思。

Sergey:你要是想学开飞机,多半得用模拟器,至少训练里有一部分得靠它。但模拟器对你来说特别讲得通,因为你一上手就有大量的世界知识,能拿来给模拟器里发生的事情打底。你知道自己在用飞行模拟器学开飞机,不是单纯在打游戏,你是想学到东西,之后用到真飞机上,你也明白这中间隔着一层抽象。你玩那种画风特别卡通的 Atari 游戏也是一样,屏幕上那些符号,你都能跟生活里经历过的事对上,能做个类比。所以这些模拟环境虽然只反映了真实世界的某些侧面,对我们来说却特别讲得通,因为我们会调动自己大量的过往经验,把模拟里缺的部分自己补上。

Sergey:还有,你自己作为一个人去看别人做某件事,比如你看别人做一顿饭,对吧?

Sergey:虽然他的每个动作你并没有亲身体会,但你有大量的知识可以调出来。你一看,行,他在拿盐罐,我以前也往东西上撒过盐,所以我大概知道这是怎么回事,我可以在加盐这个抽象层面上把它记下来,不用去搞清楚他每一块肌肉怎么动。我想说的是,一旦你理解了自己怎么用身体做事、怎么体验这个物理世界,其他这些知识来源就都能跟它接上,因为你从自身经验里得到的那个底座,能帮你给所有东西打底。

所以我的结论是,如果我们有一个机器人基础模型,是用大量真实的具身数据训练出来的,能提供这个底座,那它吸收其他知识来源的能力可能会强得多。这其实跟一些人的想法正好相反,因为看到 LLM 靠互联网数据取得的成功,很容易就想,那是不是该反过来,先从 YouTube 视频开始,再把机器人数据叠上去。但我觉得恰恰是反过来的。

我甚至有一点证据。我的同事 Suraj Nair 和 Georgia Tech 的 Simar 之前合作过一个项目,拿我们的机器人基础模型,加上人类视频数据。

Sergey:他们不是从人类视频数据开始,而是先用机器人数据训了一个模型,再把视频数据加上去。然后他们去看模型内部的表征,也就是模型怎么表示人类经验、怎么表示机器人经验。结果发现,如果用小模型、少量机器人数据,人类经验和机器人经验如预料的那样完全分开,也就是特征表征不一样。但如果你用大量机器人数据、而且来自很多不同的机器人,那特征就更多是按任务来分组,而不是按是人还是机器人来分。我们看那些特征图的时候,真的有点难以置信,因为你把机器人数据的量拉到百分之百,它们就是严丝合缝地对上了。你做个 T-SNE 嵌入,看那些嵌入的形状,几乎全是任务身份,对本体几乎没有敏感度。这对我来说挺震撼的,因为那个基础模型压根没训过任何人类数据。可你一旦把人类数据加进去,它就用完全相同的方式来表示。我觉得这特别让人兴奋。对我来说,这是最强的信号之一,说明只要你有机器人经验这个好底座,别的东西都能往上面叠,而且吸收起来反而更好。

Ryan:那个基础模型是不是必须要有用某一套特定电机、特定关节采集的数据,这重要吗?

Sergey:目前我们显然在跨本体模型上投入了很多,能处理很多不同类型的机器人。但一般来说,你确实需要你要部署的那台机器人的数据,才能有好的表现。所以这里泛化的衡量标准不是你能否零样本迁移到一台新机器人,而主要是你能不能少用一点新机器人的经验,把其他机器人的技能迁过来。这是现在的状态。

不过这里有个还挺让人意外的好消息,就是虽然你需要这些机器人的数据,但模型做的特殊处理其实很少。我们一开始做这些的时候,我列了一大张清单,全是我想做的炫酷研究,为了让模型更好地适应不同形态,比如能不能把模型的表征分解一下,弄一个六自由度手臂的头、一个七自由度手臂的头、一个夹爪的头之类的。这些我们一个都没做。模型就是输出一大串数字。如果机器人的自由度比输出的少,就直接补零。没有任何花哨的东西,就这样。然后它就在所有机器人上训练,根据摄像头看到的东西输出正确的动作。

回到你说的能不能处理新机器人。到目前为止我们重点关注的是机器人之间的技能迁移,我觉得这个方向挺有希望。而这恰恰是模型工作方式的那些具体选择会起作用的地方。比如说,你可以让模型做一些中间的思考,而这个思考可以用不同的模态来做。你可以用文字思考,文字思考特别适合迁移高层的行为结构。比如你明白,我要收拾厨房、把餐具收起来,得先开抽屉,这是一种语义推断。这种迁移得很好,因为它显然跟本体之类的基本无关。但如果你用对表征,连更低层的东西也能迁移。

我们做过一个实验,思考阶段是用图像表达的,也就是你基本上是在脑内生成任务下一个里程碑的图像。靠这个,我们居然让 UR5 机械臂叠了一件 T 恤,尽管我们没有任何 UR5 叠 T 恤的数据。因为把手部动作搞对很难,机器人做这个任务需要的关节角度完全不同,但生成一张它叠衣服时该是什么样子的图并不难。因为你看过机械臂摆出各种姿势,看过衣服在折叠和展开各个阶段的样子,大概知道它该抓在哪儿。所以用生成模型造出那张图很直接。有了图之后,反推出正确动作也很容易,你看着合成出来的手臂角度,直接反推出角度该是多少就行。所以这不是改变了问题,只是加了一个中间步骤,让问题更好解。就像你做数学题,如果找到对的中间步骤,答案从那个中间步骤就能一眼看出来。

我觉得这特别令人兴奋,因为这说明机器人之间的这种泛化,我相信其他泛化也一样,可以通过思考来促成,就跟 LLM 里一样,但有个转折:你得用对的模态去思考。

Ryan:有意思。所以那张图就是它的视觉传感器看到的东西,是下一步?

Sergey:对,你几乎可以把它想成图像编辑。视频上也一样,可以做视频预测。关键是想象一下这个任务往下推进会是什么样子。

这很像人会做的事,对吧?有些事情你是从语义上规划的,有些是从空间上规划的。比如你攀岩的时候,大概不会想,左手往左三十七厘米的那块岩点,你更可能是在想象自己的手伸向那块石头。

机器人基础模型与LLM的路线分歧


机器人基础模型与LLM的路线分歧

Ryan:前面聊天的时候你提到 Waymo 特别鼓舞人心,它走向量产的路径证明了真实世界的通用机器人是能做到的。如果我没记错,我小很多的时候,它给人的感觉是这事马上就要成了,结果现实中花了长得多的时间。放到人形机器人上,什么情况会让你说这是个位数年就能成,而不是一条长尾?我还能想象还有各种政策上的挑战。

Sergey:我觉得机器人基础模型解决问题的方式,和传统工程化系统解决问题的方式,有一个很大的区别,就是它的技术栈非常薄。训练一个基础模型当然不容易,你得拿到对的数据,数据整理、标注这些事也要花大量功夫。但真正在机器人上跑的软件其实特别简单。你可能有一个思考或者推理的环节,也可能直接让模型输出动作,它得足够快。可你要是只看代码行数,它比传统的自动驾驶技术栈少得多得多。

一部分原因是,现代自动驾驶很早就开始做了,用的技术路线很不一样,是慢慢演进过来的。另一部分是,自动驾驶在安全上更要命。你肯定不希望机械臂把一个易碎的东西摔了,但说到底,这比一辆车撞到人要轻得多。这不是说机器人的安全挑战不真实,它非常真实,而且非常重要,事实上这可能是这个问题里最难的一端。但它不至于硬生生卡住实际落地,因为你可以挑任务、挑环境、挑场景,甚至挑硬件,让这些问题严重程度低很多。

所以我觉得,软件栈极其简单,加上安全挑战没那么剧烈,这两点合起来,其实让它容易很多。而且就像你刚才说的,还有这种飞轮效应,有一个正反馈循环,只要开始把东西放到真实世界里,哪怕有一些限制条件,也会反过来让它们越来越多地走出去。

Ryan:很多人应该都熟悉复盘这个概念,就是回过头看某件事为什么失败。但在这个情况下,我更好奇你会怎么做事前复盘:如果人形机器人没能在个位数年内成功,你觉得最可能的原因是什么?

Sergey:说到底,这些东西要真正有用,就得在可靠、稳健和泛化上达到一个水平,而这个水平要比我们对 LLM,比如图像和视频生成模型的期待更高。因为那些工具本质上很依赖人来回互动。你让 LLM 做一件事,它做得不太对,你就改改 prompt,基本上就是跟它反复迭代。这也是为什么早期的 LLM 工具,比如第一版 ChatGPT,虽然比现在的东西原始得多,但已经很有用了,因为你可以一直敲它,直到它基本上把你的问题解决。就像你用搜索引擎,输进去没搜到想要的,你改一改 query,然后就搜到了。但机器人不一样,它真正的价值,是在它自主地做这件事的时候才被释放出来。

Sergey:每个任务都得有人在旁边一直迭代,这几乎跟它能带来的好处是相悖的。所以我觉得很大一部分风险在于,要达到那个可靠和稳健的水平到底有多难。这也是为什么有些 demo 可能会有点误导性,因为如果有人展示一个机器人做很酷的事情的 demo,当然,如果一切都是如实呈现的,那它仍然可以是进展的很好指标,但它并不能让人看清,距离那个真正实用的可靠性水平还有多远、有多近。所以我个人非常相信用强化学习这类方法,它能真正从自主经验里获益,把最后那百分之几调好,从百分之九十五做到真正的百分之百。这非常重要,而且目前还没有被解决。

Ryan:如果它真的比预期花的时间更长,那是因为门槛更高。

Sergey:因为门槛更高。特别是最后那一点点,可以说最后一英寸,它需要的不仅是很好的模型,还需要技术上的新突破。我不是那种会说我们应该把已知的基础模型那套东西全扔掉、从头再来的人,我完全不这么认为,我觉得我们手里的拼图片其实是很好的拼图片。但仍然要承认,现在的方法和模型还需要做更多工作,才能跨过那个可靠性水平。

Ryan:在 LLM 领域,感觉大家都在做差不多的事,只是风味不同。在机器人行业,大家是不是也在做差不多的事?有没有什么方向完全不同的激进架构?

Sergey:其实我觉得这里面的异质程度比表面看起来大得多。有一条很重要的分界线,光看结果可能不太看得出来,就是完全拥抱基础模型理念,还是聚焦在具体的垂直领域。这个有时候很难分辨,因为显然每个人都会说,我做的是 LLM 那套,因为那是时髦的东西。但基础模型理念本质上大概是这样:如果你有一个具体问题要解决,更好的做法是训练一个更通用的模型,让它能用来自一大片问题的数据。而且只要做对了,它在你要解决的那个专门问题上,会比一个窄领域的专家模型更好。

还是拿 LLM 做类比,你想做机器翻译,那就别去建一个机器翻译系统,去建一个理解所有语言任务的语言模型,然后把它丢去做机器翻译。在机器人领域,这一点其实让人非常不舒服。因为如果一个人在做具体应用,比如做仓储自动化,让他想我要做仓储自动化,那我去收集厨房里收纳餐具的数据吧,这听起来就很荒唐。但这正是基础模型的教训,只要你的面够宽,从各种各样的任务里收集数据,你就能获得那些能泛化的技能。而如果模型构建得正确,它就会把这些技能重新用到它遇到的任何情境里。

所以我觉得确实是这样,哪怕你想造一个仓储机器人,你也最好去收集覆盖面很广的数据,它在处理你在仓储这个领域里可能遇到的各种奇怪边缘情况时会更好。但这一点很难让人接受,因为它跟传统垂直整合的机器人系统那套原则太相悖了。

事前复盘、人机关系与给年轻自己的建议


事前复盘、人机关系与给年轻自己的建议

Ryan:我注意到这些 AI 公司身上有个有意思的新现象:如果它们大获成功,反而会带来一种担忧,或者说一堆新问题。比如 Anthropic 出了一个非常强大的模型,政府就进来了,然后就有各种关于安全、风险的担忧。你怎么看这件事?假如 Physical Intelligence 今年做出了一个强得难以置信的通用模型,你会怎么看那些随之而来的话题?

Sergey:做 AI 安全研究不是新事情。我在 UC Berkeley 的同事 Stuart Russell 十多年前就在谈这些了,也有很多人花了大量时间在这上面。问题在于,当技术跑得这么快的时候,重要的问题不光是取决于核心原则,还取决于社会怎么反应、会采用什么工具。

Sergey:我觉得这非常非常难预判,所以在这个问题上我没有一个很令人满意的答案。至于我们怎么应对,我们对这些事情的理念基本上是做实证实验:先把东西放出去,看看真实世界里会发生什么,看看哪些对了哪些错了,这样我们就能尽可能提前看到这项技术能做什么、弱点在哪、优势在哪。说到底,你只能睁大眼睛,看看会发生什么,然后边走边调整。

不过我觉得你这个问题问得非常到位,虽然我没有很好的答案。因为如果 AI 系统基本上还只是局限在使用计算机,我们就已经有这么多担忧和问题了,那能在这个物理世界里做所有我们能做的事的 AI 系统,我们的担忧和问题只会更多。所以问题是真实的,只是你只能边看边调整。

Ryan:这算那条可怕的路径。那在好的路径上,如果一切顺利,十年后我们有了强得难以置信的模型和机器人,北极星是不是就是人类劳动的终结?

Sergey:我认为把机器人想成机械化的人是个错误。计算机在某种程度上有点像机械大脑,但当个人电脑在九十年代、两千年初真正起飞的时候,第一件发生的事并不是人们用电脑替换了自己的大脑。我们看到的其实是各种非常不同的计算机大量出现,也就是所谓的普适计算:你桌上会有一台电脑,口袋里可能也有一台,冰箱里可能有一台,车里也有一台。因为计算变得如此容易获得,你可以在任何东西里放一点点计算。

Sergey:四五十年代最早琢磨这事儿的人根本想象不到这些。他们脑子里想的是那种占满一整个房间的计算机,用来管一整个国家的政策之类的,而不是每家冰箱里都塞一点算力。所以照这个类比,我们可能也会看到所有东西里都带一点物理执行能力,很多本来得你自己干的日常小事,现在能有人帮你搭把手。

另一个值得想的例子就是现在的编程 agent。它的终局是什么,现在当然还没定论。但从今天软件工程师的实际体验看,大概率可以说,多数人会觉得编程 agent 是在给自己加 buff,而不是让自己慌。肯定也有人慌,但总的来说,至少从我聊过的工程师和我自己的经验看,能用 AI 工具把自己能干的工作量放大,这是让人更有力量的。这个类比可能很直接,因为这就是一个实打实的真实职业,AI 进来了,也确实给做这份工作的人提供了更多杠杆。所以这也是一个可以参照的例子。但说实话,最后会怎么样还得再看。

Ryan:在 LLM 领域,有那么几篇奠基性的论文,你读完就能摸清那些真正重要的突破是怎么一路传承下来的,也就能理解我们今天是站在哪儿。那在机器人行业,有没有一组顶梁柱的论文,你觉得大家如果对人形机器人的最前沿好奇,就应该知道这些突破?

Sergey:有一点我想提一下,这算是给自己打个广告,因为我是那篇论文的共同作者,不过老实说,这个工作百分之九十九点九都是 Tony 做的,他是第一作者。就是最早的 ACT 论文,也就是 ALOHA 论文。

Sergey:这是个很有意思的例子,因为从某些角度看,里面的想法其实不算新,但呈现方式特别漂亮。

Sergey:核心思路是,如果你搭一套合适的低成本机器人系统——他那套用的是 Trossen Robotics 的机械臂,就是七千美元左右的那种爱好者级别机械臂,把它们做成双臂配置,再加一个主从遥操作设备。他证明了,只要你做对了,其实不需要什么特别花哨的技巧,你就能轻松采集到极其灵巧任务的遥操作数据,而这些任务大家以前以为必须要用非常复杂的硬件和一堆特别贵的东西才能做。然后再搭一个很直白的基于 transformer 的模型,它还真就能完成很多这类任务。

这事儿挺有意思,因为学术研究里我们通常特别看重你有没有什么高深的新数学工具,或者什么高深的技术洞见。但在这篇论文里,我觉得它到现在影响已经非常大了,它的洞见其实就是:把对的拼图片拼到一起就行。

Sergey:要对简单的机器人多一点信心,只要给它配上一套好的端到端学习系统。他演示了给遥控器换电池这种事,甚至弄了个假人脚,演示你可以在上面穿鞋,算是辅助类的任务,有些人穿鞋确实需要帮忙,这挺好。但大家觉得这篇论文最有意思的地方在于,用相对简单的积木,你能走多远。

现在他已经把代码开源了,ACT 这套代码被很多人用过。谁要是想要一套最基础的机器人学习入门套件,一般就抓这个。我觉得想入这行的人,值得把这篇论文从头到尾读一遍,真正搞明白里面在干什么。因为它虽然从某些角度看不算多高深,但它能帮你校准什么才是重要的:细节很重要,但细节不一定非得复杂。

Ryan:这是在大模型做机器人的这波浪潮之前。在那之前,Boston Dynamics 有过特别惊艳的演示,声量也特别大。我那时候甚至都不在这个领域,也会说哇,他们做的机器人真牛。然后最近这些年,具体几年我也说不好,我好像就不太听到他们的消息了。

Ryan:是行业里发生了什么转变才变成这样吗?还是说这事你能解释一下?

Sergey:我会这么解释。机器人从某个层面说就是在造复杂系统。所以虽然我们很容易说,AI 里有不同方向,有 LLM,有视觉,有机器人,但机器人跟其他那些不是一回事。因为做机器人,你得把所有零件都凑齐,从机器人怎么接线、电源是什么、执行器长什么样,一直到它怎么做高层规划来决定下一步干什么。

虽然我们看着这些视频、这些公司、这些演示,会说这全都是机器人,但它们其实是技术栈里很不一样的部分。Boston Dynamics 那些经典成果,展示的大多是极其复杂的硬件,精心设计的硬件,配上传统控制方法,由非常聪明的控制工程师一点点调出来,但对决策这一块的重视相对就少一些。

Sergey:我觉得在某个时间点上,这么做是很合理的,因为如果你连身体都造不出来,上面跑什么决策系统根本无所谓。但接着我们前面聊的泛化,现在我们已经到了这个阶段:硬件上我们还能做得更多,但很多方面已经够用了。真正的挑战变成了,怎么做出一个真正管用的决策回路,能对环境里的一切做出智能响应。

Sergey:决策回路不是说符号化的决策,也可以是底层的决策。问题在于,你需要把环境里其他东西考虑进来吗,还是你只是在跟机器人自己打交道?如果你想在平地上做后空翻,那你基本只需要处理机器人本身。但如果你想从桌上拿起一个咖啡杯,虽然这事儿从某些角度看比后空翻简单,你却真的得搞明白外部世界在发生什么,而不只是自己的身体。

Sergey:这条分界线,我觉得从技术演进的结果看,可以说就是 AI 和控制的分界线:控制是你得控制机器人的身体,AI 是你得考虑机器人之外发生的事情。我想这就是为什么会出现这种分化,因为很多演示里你主要只需要对付机器人本身,不用管外部世界,这时候好的控制方法就能给出很好的解。

还有一点我想说,如果某个特定技能需要大量控制方面的工作,那其实也有可学的东西。因为如果你能手工设计出一个控制器来完成一个复杂行为,那这个控制器大概率也是能学出来的。这就是一个存在性证明,说明这件事是可能的。而且不只可能,它还简单到一个人能搭出来。因为别忘了,即便是今天写代码,人能处理的复杂度,终究是低于 AI 能处理的复杂度的。所以如果一个人能手工设计出做后空翻或者杂技动作的东西,那就很好地证明了这个技能背后存在某种相对简洁的控制律。而简洁往往就意味着可泛化。所以如果它简单到一个人能设计出来,那里面很可能就有相当通用的东西。如果你能把它学出来并自动化,不用再把人类的控制工程师放在回路里,那就是好消息。

Ryan:最后一个问题:如果能回到你刚入行的时候,带着你现在知道的一切给当时的自己一点建议,你会说什么?

Sergey:这几年我学到一件事,跟我最初的想法不太一样,就是想把机器人做好,你得非常充分地利用广泛的先验知识。机器人学习这个圈子里很多人都有一种想法,我一开始也是这么想的,就是既然人是自己从零学起的,那机器人是不是也该从零学起。

比如我们早期在 Google 做大规模机器人学习的时候,有个项目叫机械臂农场。我们把一堆机械臂摆在一间会议室里,因为当时没有正经的实验室,只有那么一间会议室,让它们全都去抓东西。想法是,如果它们抓过几百万个物体,就能学会非常通用的抓取策略。结果基本算是成了,它们确实学会了抓取,但很难再往上走到下一个层次。就是说,现在它什么都能抓起来了,然后呢。它并没有成为通往更复杂技能的一块好跳板。

我觉得部分原因就是我们把它当成一张白纸,从零开始,看看在事先什么都不知道的情况下,机器人能不能自己学出一些行为。但我觉得,如果你能把机器人的经验和从其他来源拿来的知识结合起来,这件事会实用得多。比如语言,我一开始非常怀疑它有什么用。从科学的角度讲这个怀疑是站得住的,因为动物能做出很了不起的事,猴子能干的酷事不少,但据我所知猴子不会说话,至少说得不利索,那也许我们的机器人也不需要懂语言。但这里微妙的地方在于,关键不是语言,而是你能把先验知识作为学习过程中的脚手架放进去。而且这些知识可以用各种方式引入,人类也不是完全靠语言来引入的,人和猴子肯定都不是,它们靠观察,观察其他人、其他生物,等等。所以先验知识的来源有很多。

但重点是,你必须把先验知识放进去。否则你要解决的问题,其实比人和动物面对的问题更难。就好比一个人要学着拼 IKEA 的家具,但他这辈子从来没见过任何一件家具。那这就太难了,因为他根本不知道这玩意儿是干嘛的,也不知道最后拼出来该是什么样。所以先验知识很重要。我到现在仍然非常喜欢通过经验来学习,但我想给当年的自己的建议是,把先验知识看得更重一些。

Ryan:太棒了,非常感谢你抽出时间,Sergey Levine,真的非常感谢。也谢谢大家的提问。如果你喜欢这期节目,也希望它越做越好,可以留个评论或者点个赞支持一下;如果你想让我请谁来上节目,也欢迎在评论区留言,像 Barbara Liskov、Michael Stonebraker、Mark Brooker,这几位都是我因为有人留言才请来的。

还有一件事,除了节目之外,我在做一把我希望它存在的符合人体工学的键盘。这是原型的样子,它是分体键盘,两边分开,现在装在外壳里。我们在 Kickstarter 上线了,上线八小时内就达成了目标。如果你抢到了早期的机器,真的非常感谢。我们现在正在做漫长的开模和工装的活儿;如果你还想要一把,我在 Kickstarter 上把晚期支持留着了,可以在那儿下单,链接我会放在简介里。再次感谢收看,我们下期见。

原视频:Sergey Levine: Current State of Humanoid Robotics, China & Future Predictions

https://www.youtube.com/watch?v=9OSbaPjv0Rc

编译:磊哥Thomas

【声明】内容源于网络
0
0
象信AI
让人放心把真实工作交给AI
内容 131
粉丝 0
象信AI 让人放心把真实工作交给AI
总阅读1.9k
粉丝0
内容131