大数跨境

一百万只机器狗的订单,谁来接?

一百万只机器狗的订单,谁来接? 象信AI
2026-10-04
8
导读:英伟达 Cosmos Lab 副总裁刘洺堉:开放模型给的是能拆开、能改;世界将是多智能体的,比的是每瓦智能。

开放模型该不该做,一直有争论。但当 AI 从云端走进工厂、汽车和机器人,这件事的性质就变了。

近日,在《Practical AI》节目中,主持人 Daniel Whitenack、Chris Benson 对谈英伟达 Cosmos Lab 副总裁刘洺堉(Ming-Yu Liu)。他负责面向物理 AI 的世界基础模型 Cosmos,团队明确以公开释放模型和代码为取向,他本人也是“开放权重与美国 AI 领导力”公开信的签署方之一。

访谈里,Ming-Yu 设想了这样一个场景:一家玩具厂接到一百万只机器狗的订单,LLM 智能体盘库存、算物料,再与 B 厂车间的智能体完成一次“握手”,机器人搬货、自动驾驶卡车跨厂运输、装配线上每个工位做视觉检测——而这一切又由另一个智能体操作。

他的结论是,世界将是多智能体的,比的是每瓦智能,和每美元能买到多少智能。

左:Daniel Whitenack,中:Ming-Yu Liu,右:Chris Benson

左:Daniel Whitenack,中:Ming-Yu Liu,右:Chris Benson

01

百万只机器狗,谁来接单?

百万只机器狗,谁来接单?


数字世界里界面很清楚:你面对一个 LLM,或一个 LLM 管着一堆智能体。Chris 把问题推到极端:一旦搬进物理世界,大量设备彼此交互,“什么叫交互,这件事就变得非常复杂”。

Ming-Yu 用一个订单回答他:接了一百万台机器狗的订单,数字智能体先看库存、做高层规划,把需求发给 B 厂车间的智能体,双方“很快对接上”;机器人搬货,自动驾驶卡车跨厂运输,装配线上每个工位都有自己的控制回路,“这些又由另一个 agent 来操作”。

所以他判断:“这个世界会是多智能体的。”任务不同,要的能力就不同——“你大概不需要机械臂会解奥数题,你更希望它在某种操作任务上更灵敏”。他要的是专精化的智能体,不是一个什么都能干的万能模型。

02

API 不给你洞见,也不让你拆开模型

API 不给你洞见,也不让你拆开模型


开放模型是英伟达这两年最上心的一件事。Daniel 替商业客户问得很直接:如果我跑的是英伟达的硬件,开放模型对我到底帮在哪儿?

Ming-Yu 的回答只有两个词:“创新,自由,创新,自由。你可以用 API 来解决问题,但有了开放模型,你能做的比 API 给你的更多。”他前面谈开放模型时还说过,API 不给你洞察,不让你把模型拆开,也不让你把自己的想法塞进去——比如你想在本地算、又没有网络连接。

他还给了英伟达自己做开放模型的一个理由:模型是“一种新的库”,开放出来,人们可以先试一试、组合起来,之后也许去做自己的模型。

Chris 补了背景:几个月前西方开放模型一度举步维艰,一些领头者关停或退出,他乐见英伟达在这个时间点接棒。

而 Ming-Yu 的判断是:“一定会有一些应用,是做基础模型的前沿公司当初没预见到的,它们需要定制。”

03

每台机器人都是“批量为一”

每台机器人都是“批量为一”


物理 AI 是什么?Ming-Yu 给的定义很朴素:部署在物理设备上的 AI,这些设备会改变世界的状态,结果是以实物呈现、你能摸到的东西。三根支柱是汽车、工厂自动化、机器人,还有农业、建筑。

但落到模型上麻烦就来了。物理 AI 里最常见的是策略模型:视觉观测加交互输入,输出动作。可每台设备的传感器配置都不一样。有的机器人把摄像头装在自己的夹爪上;自动驾驶汽车有的装十一个摄像头,有的装七个,有的还带激光雷达。“你很难用一个模型把这些全包住。”

真正的硬约束在推理侧。机器人得反应非常快,“很多任务是批量为一的推理问题”。LLM 受内存带宽约束——云端可以把不同用户的请求聚起来填满 GPU,可嵌入式设备没有请求可以聚合,“那台机器的算力就用不满”。他给出的演进主线是每瓦智能。

任务不同,要的能力就不同——机械臂不需要会解奥数题,需要的是在某个操作任务上更灵敏。

04

不用输入输出定义世界模型

不用输入输出定义世界模型


LLM 是输入文本、输出文本,图像模型是输入文本、输出图像,那世界模型的输入输出是什么?Ming-Yu 拒绝了这个提问方式:“我觉得很难用输入输出这种东西去定义什么是世界模型。我更愿意说,对世界的某种建模就是世界模型。”

他随后还是拆开讲了。世界仿真:输入是当前观测加动作序列,输出是未来,可能是视频也可能是音频。世界理解:机器人任务没完成,你想知道发生了什么,输入视频,输出一段人能听懂的解释。Cosmos 3 把两者合成一个模型,“虽然目的不同,但建的是同一个世界”。

Chris 追问:游戏里常见的仿真器和世界模型是什么关系?Ming-Yu 说,经典仿真器是人类把世界如何运转写成方程,再在方程之上搭程序;神经仿真则是数据驱动的近似,靠模式识别预测接下来会发生什么。

05

先让策略跟世界模型过上招

先让策略跟世界模型过上招


世界模型怎么用?Ming-Yu 举了自动驾驶的例子。训一个把车从 A 地开到 B 地的策略模型,开发中会有很多检查点,问题是“我怎么知道检查点 A 比检查点 B 好?”过去的办法是养一批车加一批司机,每有新策略就上真实路况,他直言这“显然没法扩展”。有了世界模型,策略不用上车跑真实路况,而是直接和世界模型过招:向左打方向会看到什么,向右打方向会看到什么。先砍掉一批假设,剩下几个真正有价值的,再上真车测。“在技术里最重要的就是你能迭代多少次。”

Daniel 最担心级联失败——某个地方出了个小问题,智能体相互作用,最后演变成系统级故障。Ming-Yu 先泼冷水:那幅多智能体协作完成生产的图景,“可能还得几十年,我们离那儿还远”。验证正确性极为重要,他预计车间里会有监督型智能体专门抓还没被识别出来的问题;人形机器人进化得非常快,但还没准备好大规模商用。这些事靠一家公司单打独斗很难,“需要整个生态”。

所以英伟达的开放模型不只是开放权重,还有训练框架和开源的训练数据:模型放在 Hugging Face,配方手册放在 GitHub。

问题该交给做产品的人了。如果你在做机器人、汽车或工厂里的软件,你会先等一个足够好的闭源 API,还是现在就拿开放权重、用自己设备上采的数据把它改到能用?

原节目:Practical AI《Open models and the future of Physical AI with NVIDIA》

【声明】内容源于网络
0
0
象信AI
让人放心把真实工作交给AI
内容 129
粉丝 0
象信AI 让人放心把真实工作交给AI
总阅读1.7k
粉丝0
内容129