点击蓝字
关注我们
AI TIME 欢迎每一位 AI 爱好者的加入!
论文整理、编辑|蒲诗瑶
arXiv 预印本
论文题目:Show-Harness: Just a VLM Agent Can Play Robots
论文作者:Yanzhe Chen*, Zechen Bai*, Zhijun Cao*, Wenzheng Zeng*, Kevin Qinghong Lin, Yiqi Lin 等(* 为共同一作)
作者机构:新加坡国立大学(National University of Singapore)Show Lab
论文链接:https://arxiv.org/abs/2609.10522
项目主页
https://showlab.github.io/Show-Harness/
图 1 | 论文 Fig.1,Show-Harness 跨任务、跨场景、跨机器人本体的操作总览
VLM 会看会想,为什么开不好机械臂
当前的视觉 - 语言模型(VLM)已具备识别物体、分辨方位及拆解任务步骤的能力。然而,将语义知识转化为机器人行为仍存在障碍。现有路线主要面临两大瓶颈:
一是视觉 - 语言 - 动作模型(VLA),通常需将预训练模型适配为低层动作策略。这种“以语义换控制”的方式在任务或环境变化时,往往需要新的轨迹数据或重新训练。
二是分层或程序化系统,VLM 仅产出子目标,物理实现交由下游控制器。这种方式虽保留了语义,但模型无法感知意图如何落地,且需复杂的接地管线。
Show-Harness 提出了一种新思路:设计一个对 VLM 语义可读、又细到足以直接驱动物理运动的动作空间。类似于数字世界中鼠标和键盘的通用接口,该方案旨在填补模型与物理细节之间的缝隙。
答案:一套十几个词的“语义动作手柄”
Show-Harness 定义了一套极简的动作词表,包含 MV_FWD(前移)、MV_BACK(后移)、ROTATE_CW(顺时针旋转)、GRASP(抓取)、RELEASE(释放)等十余个指令。其设计遵循三大原则:
- 增量式:每个动作仅引起微小的物理变化,模型可通过“执行 - 观察 - 修正”的闭环实现精确对位。
- 可解释且本体无关:动作为符号而非数值,底层控制由解释器处理,确保接口在不同机器人上的一致性。
- 视觉锚定:移动方向基于当前画面定义,直接映射 VLM 的空间推理能力。
系统中的“解释器”是关键组件,它将语义动作确定性地转化为 6 自由度笛卡尔位姿更新。无论是 Franka 还是 AgileX 机械臂,只需更换对应的本体解释器,模型侧即可保持同一套语义接口。
图 2 | 论文 Fig.2,同一语义动作接口连接多种机器人本体
与将整段技能暴露为原语的系统不同,Show-Harness 暴露的是“怎么做”本身。物理实现透明且确定,VLM 需对细粒度的物理决策负责。
接口之外:插件化的感知—推理—执行闭环
除核心词表与解释器外,Show-Harness 通过一组可插拔插件构建闭环:
- 感知侧:多视角指引区分全局与局部视野;本体感觉插件将夹爪状态等转化为文本提示,弥补视觉深度估计的不足。
- 推理侧:包含子任务规划、情境化规划(推迟不确定决策)、动作分块(远距离时一次输出多步)及自适应步长切换等模块。
- 执行侧:动作历史插件防止振荡,失败恢复插件检测空抓并自动回滚重试。
图 3 | 论文 Fig.3,感知—推理—执行的插件化架构
消融实验显示,移除子任务规划成功率降至 60%,去掉失败恢复降至 72%。情境化规划与视觉提示在特定场景下可将成绩从 35%-40% 大幅提升至 85%。
一个接口,两种玩法:前沿模型零样本,小模型两小时微调
该架构支持两种低成本使用方式:
玩法一:前沿 VLM 零样本上机。使用 Gemini-3.1 Pro 等模型,无需微调。由于词表小且格式约束强,超过 98% 的输出为合法动作单元。
玩法二:2B 小模型轻量微调。使用 Qwen3.5-2B,仅更新约 3% 参数(LoRA),单张 H200 显卡训练不到 2 小时即可达到 86% 的成功率。推理可在消费级显卡上本地运行。
两种玩法共享 GUMI 数据接口,语义动作可映射为键盘按键或界面按钮。数据采集无需专用遥操作硬件,仅需 164 条真机演示和 230 条仿真数据即可完成训练,相关数据已开源。
图 4 | 论文 Fig.4,人类、界面智能体与 VLM 智能体通过同一 GUI 采集演示
89% 对 57%:三个维度上的泛化
在 10 个真实抓放任务中,Show-Harness 零样本模式平均成功率达 89%,微调 2B 模式为 86%,显著优于最强基线 RATS 的 57% 和 π0.5 的 39%。
跨环境与跨本体:零样本模式在背景、光照等视觉偏移下保持 100% 成功率;更换机械臂本体后,成功率仍保持在 90% 以上。
模拟到现实(Sim-to-Real):仅用仿真数据训练的微调模式,在真机上取得了 65% 的成功率,而对比基线均为 0%。这表明语义动作空间有效减少了对特定低层轨迹的依赖。
图 5 | 论文 Fig.6,物理适应性与语义适应性的专项实验汇总
专项实验进一步证明,离散旋转单元可通过多步组合外推到未见过的角度,而连续动作策略则表现出更强的训练依赖。在视频上下文学习中,引入演示流程后,系统能成功完成未指定顺序的复杂收纳任务。
拆开接口看:真正起作用的是什么
消融实验揭示,动作接口的有效性主要源于“书面约定”而非语义名称本身。只要明确定义每个符号对应的物理行为,即使使用任意符号也能达到接近默认设置的效果。
此外,提升模型推理档位主要减少冗余步数,对成功率增益有限。在特定任务中,2B 小模型因响应速度快,表现甚至优于大模型。
边界与启发
目前实验局限于平行爪夹持器,尚未验证灵巧手等复杂本体,且缺乏触觉反馈。步长设定也限制了长程任务的效率。
尽管如此,Show-Harness 提供了一种新的接口设计思路:通过语义动作接口,在不增加额外动作头的情况下调用基础模型能力,并大幅降低对本体特定数据的依赖。仅需少量数据和极低算力,即可实现高效的机器人控制。数据与代码的开源,将为接口派与端到端派的对比研究提供重要基准。

