大数跨境

把机器人做成“游戏手柄”:NUS Show Lab 的 Show-Harness 让 VLM 零样本开机械臂

把机器人做成“游戏手柄”:NUS Show Lab 的 Show-Harness 让 VLM 零样本开机械臂 AI TIME 论道
2026-09-10
2
导读:今天的视觉-语言模型(VLM)认得出积木和碗,分得清左右和远近,也能把"把香蕉放到盘子里"拆成抓取、移动、放置几步。论文开篇即指出:操作机器人所需的知识,VLM 大多已经具备,缺的是把这些知识变成机器

点击蓝字

关注我们

AI TIME 欢迎每一位 AI 爱好者的加入!


论文整理、编辑|蒲诗瑶


本文内容基于公开论文资料整理,相关研究成果版权归原作者及所属机构所有。我们尊重每一位研究者的原创贡献,如有任何建议或权益相关问题,欢迎联系我们,我们将及时沟通处理。

arXiv 预印本


  • 论文题目:Show-Harness: Just a VLM Agent Can Play Robots

  • 论文作者:Yanzhe Chen*, Zechen Bai*, Zhijun Cao*, Wenzheng Zeng*, Kevin Qinghong Lin, Yiqi Lin 等(* 为共同一作)

  • 作者机构:新加坡国立大学(National University of Singapore)Show Lab

  • 论文链接:https://arxiv.org/abs/2609.10522

  • 项目主页

    https://showlab.github.io/Show-Harness/

【导读】新加坡国立大学 Show Lab 提出 Show-Harness:不给视觉 - 语言模型(VLM)额外增加动作头,而是通过一套十来个词的“语义动作手柄”、本体专属解释器以及感知—推理—执行闭环,让未经微调的前沿 VLM 直接参与真实机械臂控制。实验显示,10 个抓放任务平均成功率达 89%,最强基线仅为 57%;同一接口下,仅用约 3% 参数的 LoRA、单卡不到 2 小时,即可将 2B 小模型微调到 86% 的成功率。


图 1 | 论文 Fig.1,Show-Harness 跨任务、跨场景、跨机器人本体的操作总览

VLM 会看会想,为什么开不好机械臂

当前的视觉 - 语言模型(VLM)已具备识别物体、分辨方位及拆解任务步骤的能力。然而,将语义知识转化为机器人行为仍存在障碍。现有路线主要面临两大瓶颈:

一是视觉 - 语言 - 动作模型(VLA),通常需将预训练模型适配为低层动作策略。这种“以语义换控制”的方式在任务或环境变化时,往往需要新的轨迹数据或重新训练。

二是分层或程序化系统,VLM 仅产出子目标,物理实现交由下游控制器。这种方式虽保留了语义,但模型无法感知意图如何落地,且需复杂的接地管线。

Show-Harness 提出了一种新思路:设计一个对 VLM 语义可读、又细到足以直接驱动物理运动的动作空间。类似于数字世界中鼠标和键盘的通用接口,该方案旨在填补模型与物理细节之间的缝隙。

答案:一套十几个词的“语义动作手柄”

Show-Harness 定义了一套极简的动作词表,包含 MV_FWD(前移)、MV_BACK(后移)、ROTATE_CW(顺时针旋转)、GRASP(抓取)、RELEASE(释放)等十余个指令。其设计遵循三大原则:

  • 增量式:每个动作仅引起微小的物理变化,模型可通过“执行 - 观察 - 修正”的闭环实现精确对位。
  • 可解释且本体无关:动作为符号而非数值,底层控制由解释器处理,确保接口在不同机器人上的一致性。
  • 视觉锚定:移动方向基于当前画面定义,直接映射 VLM 的空间推理能力。

系统中的“解释器”是关键组件,它将语义动作确定性地转化为 6 自由度笛卡尔位姿更新。无论是 Franka 还是 AgileX 机械臂,只需更换对应的本体解释器,模型侧即可保持同一套语义接口。

图 2 | 论文 Fig.2,同一语义动作接口连接多种机器人本体

与将整段技能暴露为原语的系统不同,Show-Harness 暴露的是“怎么做”本身。物理实现透明且确定,VLM 需对细粒度的物理决策负责。

接口之外:插件化的感知—推理—执行闭环

除核心词表与解释器外,Show-Harness 通过一组可插拔插件构建闭环:

  • 感知侧:多视角指引区分全局与局部视野;本体感觉插件将夹爪状态等转化为文本提示,弥补视觉深度估计的不足。
  • 推理侧:包含子任务规划、情境化规划(推迟不确定决策)、动作分块(远距离时一次输出多步)及自适应步长切换等模块。
  • 执行侧:动作历史插件防止振荡,失败恢复插件检测空抓并自动回滚重试。

图 3 | 论文 Fig.3,感知—推理—执行的插件化架构

消融实验显示,移除子任务规划成功率降至 60%,去掉失败恢复降至 72%。情境化规划与视觉提示在特定场景下可将成绩从 35%-40% 大幅提升至 85%。

一个接口,两种玩法:前沿模型零样本,小模型两小时微调

该架构支持两种低成本使用方式:

玩法一:前沿 VLM 零样本上机。使用 Gemini-3.1 Pro 等模型,无需微调。由于词表小且格式约束强,超过 98% 的输出为合法动作单元。

玩法二:2B 小模型轻量微调。使用 Qwen3.5-2B,仅更新约 3% 参数(LoRA),单张 H200 显卡训练不到 2 小时即可达到 86% 的成功率。推理可在消费级显卡上本地运行。

两种玩法共享 GUMI 数据接口,语义动作可映射为键盘按键或界面按钮。数据采集无需专用遥操作硬件,仅需 164 条真机演示和 230 条仿真数据即可完成训练,相关数据已开源。

图 4 | 论文 Fig.4,人类、界面智能体与 VLM 智能体通过同一 GUI 采集演示

89% 对 57%:三个维度上的泛化

在 10 个真实抓放任务中,Show-Harness 零样本模式平均成功率达 89%,微调 2B 模式为 86%,显著优于最强基线 RATS 的 57% 和 π0.5 的 39%。

跨环境与跨本体:零样本模式在背景、光照等视觉偏移下保持 100% 成功率;更换机械臂本体后,成功率仍保持在 90% 以上。

模拟到现实(Sim-to-Real):仅用仿真数据训练的微调模式,在真机上取得了 65% 的成功率,而对比基线均为 0%。这表明语义动作空间有效减少了对特定低层轨迹的依赖。

图 5 | 论文 Fig.6,物理适应性与语义适应性的专项实验汇总

专项实验进一步证明,离散旋转单元可通过多步组合外推到未见过的角度,而连续动作策略则表现出更强的训练依赖。在视频上下文学习中,引入演示流程后,系统能成功完成未指定顺序的复杂收纳任务。

拆开接口看:真正起作用的是什么

消融实验揭示,动作接口的有效性主要源于“书面约定”而非语义名称本身。只要明确定义每个符号对应的物理行为,即使使用任意符号也能达到接近默认设置的效果。

此外,提升模型推理档位主要减少冗余步数,对成功率增益有限。在特定任务中,2B 小模型因响应速度快,表现甚至优于大模型。

边界与启发

目前实验局限于平行爪夹持器,尚未验证灵巧手等复杂本体,且缺乏触觉反馈。步长设定也限制了长程任务的效率。

尽管如此,Show-Harness 提供了一种新的接口设计思路:通过语义动作接口,在不增加额外动作头的情况下调用基础模型能力,并大幅降低对本体特定数据的依赖。仅需少量数据和极低算力,即可实现高效的机器人控制。数据与代码的开源,将为接口派与端到端派的对比研究提供重要基准。

【声明】内容源于网络
0
0
AI TIME 论道
AI TIME是一群关注人工智能发展,并有思想情怀的青年学者创办的圈子,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,链接全球AI学者,以辩论的形式探讨人工智能领域的未来
内容 2192
粉丝 0
AI TIME 论道 AI TIME是一群关注人工智能发展,并有思想情怀的青年学者创办的圈子,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,链接全球AI学者,以辩论的形式探讨人工智能领域的未来
总阅读52.3k
粉丝0
内容2.2k