大数跨境

李飞飞高徒黄文龙:具身智能需要一次「脑内搜索」革命 | RSS 2026

李飞飞高徒黄文龙:具身智能需要一次「脑内搜索」革命 | RSS 2026 AI科技评论
2026-07-21
7
导读:斯坦福团队提出:机器人不需要见过所有的失败,它只需要学会如何“脑补”另一种可能。
斯坦福团队提出新范式:机器人无需遍历所有失败场景,只需学会“反事实推理”与“脑内搜索”,即可在物理世界中实现能力跃迁。

作者丨岑峰

在 AGI 的演进版图中,大语言模型凭借 Scaling Law 和海量文本数据开辟了智能通途。然而,具身智能领域若盲目复制这一“数据崇拜”路径,试图通过喂入百万小时视频让机械臂无所不能,将面临物理世界的严峻挑战。

2026 年悉尼 RSS 大会指出,物理数据具有时空“不可逆性”:文本可瞬间复制,而机械臂的一次抓取需实打实地消耗时间。更致命的是长尾效应——摩擦、形变、流体等复杂变量,使得人类无法通过穷举法收集机器人面临的所有场景。

针对这一困境,来自斯坦福大学李飞飞实验室的黄文龙(Wenlong Huang)在"Data-Centric Robotics"主题 Workshop 上提出了“降维打击”式的解法:抛弃对海量“演示数据”的死记硬背,转向“反事实推理”与“脑内搜索”。

作为具身智能领域的明星学者,黄文龙此前因 VoxPoser 和 ReKep 两项里程碑式研究闻名。他利用大模型作为空间规划器,将抽象指令转化为三维空间的“关键点约束”和“价值场”,首次让机器人在无行为演示下,仅凭几何常识即可完成复杂操作。

此次 RSS 2026 分享中,黄文龙将这一理念推向终极形态——Point-World。该模型赋予机器人“零样本预测未来物理演变”的数字孪生大脑,使其能在行动前于脑海中虚拟尝试成千上万种反事实可能性,从而自主创造出如“将袜子由内而外翻转”等未见过的独创性行为。

实验数据显示,仅需 15 小时的 3D 交互数据配合 2D 预训练,即可撬动世界模型的惊人扩展能力。这为具身智能走向“递归自我改进(Recursive Self-improvement)”推开了大门,为全球开发者提供了一套突破算力与数据封锁的进化算法。

以下是黄文龙演讲内容的精编实录:

01 通过反事实推断实现机器人数据的跨越式扩展

演讲者:斯坦福大学 黄文龙(导师:李飞飞)

一、动机:从“演示学习”到“自主探索”

本次 Workshop 聚焦“以数据为中心的机器人学”。核心观点在于:我们或许可以通过“反事实推断(Counterfactuals)”有效扩展机器人的能力边界。

过去几年,开放世界机器人在算法架构(如扩散策略、VLM、世界模型)和低成本硬件普及方面进展显著。行业共识认为:“只要我们能演示出来的行为,策略就能学会。”

然而,Physical Intelligence 展示的一个任务揭示了局限:机器人仅用普通平行夹爪完成“将袜子由内而外翻转”。这一动作难以用语言或代码精确描述,必须依赖视频理解。更重要的是,人类拥有“独创性(Ingenuity)”,能在新问题面前即兴创造解法,而这种自主获取新行为的能力正是当前机器人所缺失的。仅依赖互联网规模数据或历史数据,机器人难以跨越某些能力鸿沟。

二、反事实推断与搜索的价值

复制人类独创性的关键在于反事实思维,即评估:“如果我采取一组完全不同的动作,结果会怎样?”

回顾 AI 发展史,AlphaGo 著名的“第 37 手”便是通过搜索和推演得出的最优解,而非人类既有经验。数据显示,若移除测试时的搜索过程,模型需增加 10 万倍的数据量才能维持同等性能。鉴于机器人学比围棋更复杂,“反事实推理”和“搜索”能力不可或缺。

三、为什么是 3D 几何空间?

反事实推理应在何种维度进行?

1. 语言与代码空间: 虽逻辑可行,但在涉及底层物理交互(如翻袜子)时,语言模型无法描述物理细节。

2. 动作空间: 机器人形态各异,难以建立统一通用的低级动作空间。

结论:推理的最佳空间是基于机器人几何结构的 3D 空间。

最新工作Point World的核心理念是:给定 RGB-D 输入和机器人描述文件(URDF),将动作空间统一定义为"3D 点云流(3D Point Flows)”。通过采样连杆点并计算正运动学,场景观测与机器人动作被统一在 3D 点云流中。训练出的基于 Transformer 的模型,本质上是一个“零样本真实世界模拟器”。

该模型不仅能模拟刚体,还能处理流体、布料等可变形物体,无需物体分割。它能隐式识别关节结构,并在遮挡情况下根据物理常识推断接触几何关系。

四、弥补 3D 数据的匮乏

针对 3D 数据稀缺问题,团队利用视觉几何模型对大规模交互数据(Joy 数据集)进行重标注,生成了约 3500 小时具有仿真级精度深度信息和相机位姿的 3D 点云。

更具突破性的是未发表成果:利用 2D 视频数据预训练,辅以仅15 小时的 3D 交互数据微调,即可获得优于此前 500 小时训练的环境动力学预测能力。该模型在未见过的环境和机械臂上,依然保持极高的物理保真度。

五、总结与展望

在算力和数据扩展时代,关注点不应仅限于“获取更多数据以实现零样本泛化”。真正的学习应伴随机器人的一生。机器人必须具备自主获取新行为并将其编译进现有模型的能力。

通往人类水平物理交互的路径如下:

1. 前提条件: 获得关于行为和动力学的通用先验(世界模型)。

2. 关键步骤: 将先验在物理世界落地,通过反事实推断和搜索,不断探索并获取新行为。

这正是具身智能领域追求的“递归自我改进(Recursive Self-improvement)”。

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8849
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读196.2k
粉丝0
内容8.8k