大数跨境

斯坦福吴佳俊ECCV 演讲:机器需要怎样的「世界表示」,才能真正开始行动?| ECCV 2026

斯坦福吴佳俊ECCV 演讲:机器需要怎样的「世界表示」,才能真正开始行动?| ECCV 2026 AI科技评论
2026-09-12
13
导读:统一的是结构,困难的是抵达。
统一的是结构,困难的是抵达。

作者丨吴思梦

编辑丨岑峰

9 月 9 日,在瑞典马尔默举办的 ECCV 2026 会议上,斯坦福大学计算机科学助理教授吴佳俊成为全场最忙碌的学者之一。他在一天内辗转多个 Workshop 发表演讲,核心议题直指具身智能的痛点:当机器人踏入充满未知与突发状况的物理世界,究竟该如何“行动”?
这比单纯的“识别像素”或“执行动作”更为宏大且艰难。人类凭借对世界的理解,能轻松应对厨房中盘子下的垃圾或临时改变的任务;而机器人面对的是不断变化、充满例外的物理环境。真正的挑战在于让机器人理解动作为何成立,并将局部技能重组为完整任务。
二十天前,吴佳俊在德国不来梅获得 IJCAI ECAI 2026“计算机与思想奖”,探讨了机器如何从像素中理解几何与物理属性(即“物理代码”)。而在马尔默,他进一步追问:如果机器已获得世界的表示,如何利用这些表示去行动?这恰好跨越了具身智能最棘手的距离——从“知道世界是什么”到“知道该做什么”。
吴佳俊给出的答案并非再造一个全知模型,而是将复杂操作拆解为可验证、组合的原子技能;在无演示情况下推断陌生物体的操作方式;以及从视频生成模型中蒸馏交互轨迹,为机器人提供“现成的演示”。以下是他在 ECCV 2026 Physical AI Workshop 上的演讲精编。

▎Beautiful Equations for Visual Representation

主讲人:吴佳俊,斯坦福大学

01 机器人的难题,是“盘子下面还有垃圾”

本次 Workshop 的主题是“结构化视觉表示”,这与吴佳俊原定演讲标题"Visual Representation 的优美方程”不谋而合。但他强调,不仅要发展视觉表示,更要解决如何将这些结构与生成式 AI 接入物理世界,使机器人能在复杂现实中与人协作。
当前的痛点已不再是“是否使用基础模型”,而是“如何用好”。特别是在数据稀缺的私有场景中,系统需具备快速泛化和适应新环境的能力。
以清洗盘子为例:若人类中途离开,机器人不仅需识别物体,还需规划行动流(拿起、冲洗、放置、关水)。更困难的是应对变化:若盘子被放回桌上,机器人需识别其已干净而跳过清洗;若发现盘子下压着垃圾,需重写行动流先清理桌面。这种在熟悉环境中处理意外、在全新环境中面对陌生物体的泛化能力,是具身智能的核心挑战。

02 把长任务拆开:状态、动作与可验证的技能

为此,团队探索了一种新的范式:组合式抽象推理(compositional abstractions for inference)。该框架包含原始观测(图像、视频、语言)、基础模型(感知与理解)以及组合式抽象(原子技能)。
具体而言,系统从视频演示中学习三要素:
  • 状态(States):如“物体是否脏”、“物体 A 是否在 B 上方”,由神经网络验证。
  • 动作(Actions):即原子技能,如“洗”。执行该技能需满足前置条件(拿住物体、开水龙头),并产生后置效果(物体变干净)。
  • 关系:定义状态与动作之间的逻辑,赋予系统组合性。
这种表示允许系统进行推演:若前置条件满足,执行动作会发生什么?关键在于,这些抽象并非手工编码,而是由神经网络从数据中发现和验证的,从而避免退化为无法泛化的传统规划系统。

03 物理世界里的 Claude Code

这一思路与数字空间的"Claude Code"异曲同工:将复杂任务拆解为步骤,生成文件,并最终验证需求是否满足。在物理世界中,这意味着发现技能、验证条件、串联操作以完成长程任务。
系统可利用现成的视觉语言模型(VLM)提出抽象或判断状态。面对从未见过的全新物体(如生产线上的随机零件),系统可通过微调网络进行推理。一旦建立起这种“表格”化的监督信号,系统便能泛化到新物体、新本体及不同目标。
早期版本局限于 2D 验证,难以处理复杂的空间结构问题。扩展系统随后引入随时间变化的三维点云(点云轨迹),实现了对物体检测、状态验证及空间关系的全面推理。这使得系统能处理更长周期的任务,例如将训练时仅演示过抓取一本书的技能,泛化为同时抓取并放置两本书。

04 没有演示,就让物体自己说出“能被怎么动”

若无视频演示,系统能否推理出与陌生物体的交互方式?团队提出了“神经运动学”(Neural Kinematics)概念。其核心假设是:即便无演示,物体本身固有的运动学空间(kinematic space)也蕴含了交互的先验知识。
通过编码器 - 解码器框架(条件 VAE),系统学习物体的形变场。测试时,仅需输入静态网格,即可采样预测物体可能的形变与交互方式。实验显示,即便输入是由 iPhone 扫描生成的含伪影的低质量三维数据,系统仍能实现零样本泛化,准确预测水龙头、笔记本电脑等物体的交互可能性,为机器人提供了“免费的演示”。

05 向视频模型借一个世界

另一条路径是利用视频扩散模型和视频语言模型的海量知识。既然这些模型能生成逼真的交互视频,说明它们已捕捉到物体运动的规律。团队尝试通过分数蒸馏采样(SDS)的广义版本,将四维(3D+ 时间)表示的知识从视频模型中蒸馏出来。
给定静态场景和文本提示(如“机器人抓起砖块”),系统优化四维高斯表示,使其渲染出的视频符合视频模型的先验分布。这种方法无需真实演示,即可生成密集的点追踪轨迹和逼真的交互序列(如猫跳上坐垫、篮球撞击篮筐),为机器人训练提供了大量合成监督信号。

06 怎么判断一台机器人真的“想明白了”

为评估结构化表示的有效性,团队构建了多个基准:
  • Inact (CoRL 2026):评估推理分解能力。要求模型根据状态变化对给定动作进行排序,而非直接生成动作。
  • 具身空间智能基准:允许智能体移动以获取信息,回答关于三维表示、数量、布局及目标导向动作的问题。
  • 家庭活动挑战赛:基于美国劳工部数据筛选出的高频家庭活动(如聚会后打扫、清理淋浴间),构建了包含千项活动的仿真环境与基准。首届挑战赛已成功举办,采集了 3000 小时人类演示,旨在推动长程任务的研究。

07 结语:表示是统一的,难的是如何得到它

回顾全文,核心在于如何从三维、四维及语言数据中发现结构化表示,并利用基础模型解决数据稀缺问题。未来的机会在于利用大模型中蕴含的丰富信息,克服机器人数据采集的瓶颈,实现从理解到行动的跨越。

08 Q&A

▎Q1:能否直接用基础模型的隐式表示训练机器人,忽略显式部分?

A:在我们的方法中,视频扩散模型仅作为先验计算分数(类似 SDS),并未真正生成视频。若指完全在隐空间学习(如 Dreamer),这确实是一种方向。但目前的 World Action Models 在利用海量视频数据方面表现更为惊人。未来结合大模型与隐式学习将是重要趋势。

▎Q2:当奖励模型或指标过时,如何检测和修复?

A:这是表示学习社区的共性难题。对于小模型(如 FID),过时风险较大;但对于强大的基础模型,其泛化能力强,过时可能性较小。理想的解决方案是引入“人在回路”持续收集更新数据,但这面临成本瓶颈。

▎Q3:不同来源学到的结构似乎不统一,如何看待?

A:我认为表示本质是统一的,即物体的几何类型、任务结构及依赖关系。分歧主要在于:统一的表示具体是什么?如何表征它?以及如何高效地获取它。无论输出形式是点云还是其他,核心逻辑是一致的。
// 推荐阅读

腾讯混元、清华、南洋理工联手,「以小博大」破解空间智能算力与记忆断裂难题 | ECCV 2026

群核科技联手英伟达、英特尔、浙大,三篇 ECCV 论文给物理 AI 造基础设施

未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8948
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读241.9k
粉丝0
内容8.9k