Show-Harness:一个 VLM 智能体即可驾驭机器人 Show-Harness: Just a VLM Agent Can Play Robots
用紧凑的语义动作接口,让基础 VLM 零样本或数 GPU 小时微调即可直接操控机器人
前置知识
VLM(视觉语言模型)
在海量图文数据上预训练的多模态大模型,能同时理解图像与文本并生成语言。它天然具备物体识别、空间关系判断、长程目标分解等广泛世界知识。本文的出发点是:这些知识不需要改动模型本身就可以被"调用"来控制机器人。文中 Gemini-3.1 Pro、GPT-5.6 系、Opus 5 等闭源前沿模型,以及 Qwen3.5-2B、InternVL 等开源小模型都属于此类。
本文的全部设计都围绕「如何把 VLM 的语义决策落到物理世界」展开:ZS 模式直接驱动闭源前沿 VLM,FT 模式微调开源小 VLM,不理解 VLM 的能力边界就无法理解论文动机与两种模式的分工。
VLA(视觉-语言-动作模型)
在 VLM 骨干上接入动作生成机制(连续动作回归、扩散、流匹配,或离散 motor token),端到端地把观测和指令直接映射为低层机器人控制的模型,代表工作有 $\pi_{0.5}$ 和 GR00T。它需要机器人轨迹做微调,动作表示往往与特定本体绑定,换任务或换机器人常要重新采集数据再训练,且学到的映射不透明。
VLA 是本文最主要的对比基线族。论文的核心论点——「为控制而微调会牺牲语义」——正是针对 VLA 范式提出的,主实验(Table 2)和能力分析(Figure 6、Figure 8)都反复用 $\pi_{0.5}$、GR00T 做对照。
语义动作单元(semantic action unit)
Show-Harness 暴露给模型的离散动作词汇:$MV\_FWD/BACK/LEFT/RIGHT/UP/DOWN$ 六个相对参考视角的平移单元、$ROTATE\_CW/CCW$ 配轴的增量旋转单元、$GRASP/RELEASE$ 夹爪开合和 $DONE$ 完成信号。每个单元语义直观(如"向左移动一步")、物理效果小而确定,人类和模型都能直接操作。
它是论文的核心接口:方法架构(Figure 3)、两种控制模式、插件消融(Figure 9)和动作表征消融(Figure 10)全部围绕这套词汇展开,是理解全文的钥匙。
本体解释器与 6-DoF 位姿设定点
每类机器人本体(Franka、AgileX、仿真器)各配一个确定性解释器 $g_E$,把语义单元映射为控制:更新末端执行器的 6-DoF 笛卡尔位姿设定点 $s_t = (x_t, Q_t)$,即三维位置加三维姿态,再由阻抗控制(Franka)或逆运动学加关节目标流(AgileX)跟踪。工作空间、桌面高度等安全限位也在解释器内执行前拦截。
解释器是「语义到物理」的桥梁。理解它才能明白为什么同一套动作词汇能零改动跨本体复用、为什么把步长从 2cm 改成 1cm 就能适配精细操作而无需重训策略。
LoRA 低秩适配微调
一种参数高效微调方法:冻结预训练模型权重,只训练插入各线性层的低秩矩阵。本文对 Qwen3.5-2B 的所有语言模型线性层加 rank-64 的 LoRA,同时冻结视觉编码器和多模态投影层,仅更新约 3% 参数,在几张 GPU 时内用 164 条真机演示教会小模型直接输出语义动作 token。
FT 模式的低成本(对比 VLA 训练)建立在 LoRA 之上,而它能起效的前提是动作用 VLM 原生词汇表示、不需要专用动作头——这是方法设计的关键闭环。
Sim-to-Real 迁移
先在仿真器(本文用 ManiSkill 和 RoboLab)中采集数据或训练策略,再部署到真实机器人。语义动作接口只描述"相对视角的方向移动"这类与渲染细节无关的抽象,天然缓解仿真与真实的分布差异:本文 FT 策略仅用 230 条仿真演示就在真机 Franka 上拿到 13/20,而同样设置的 $\pi_{0.5}$ 和 GR00T 都是 0/20。
Sim-to-real 是 Cross-Environment 实验的关键一环,直接展示了接口抽象带来的分布鲁棒性优势,也是论文相对 VLA 最有说服力的证据之一。
研究动机
把基础模型的智能落到机器人控制上有两条主流路线,各有硬伤。其一是视觉-语言-动作(VLA)模型:把 VLM 微调成回归特定本体的连续动作,代表如 $\pi_{0.5}$ 和 GR00T。这种"像素到执行"的映射不透明,广泛语义知识被压缩进传感器运动映射,换任务、换环境、换本体都要重新采轨迹微调——论文实验中,在仅 164 条真机演示上微调后,$\pi_{0.5}$ 在十个抓放任务上平均成功率只有 39%,GR00T 只有 35%;面对棋子这类精细物体 GR00T 是 0/10 全败;只用仿真演示做 sim-to-real 时两者均为 0/20。其二是层级/程序化系统:VLM 输出子任务调用或对手写控制 API 的程序(如 CaP-X、RATS),物理执行交给下游控制器。这保留了语义,但模型只表达意图、看不到意图如何被物理实现,且每种中间表示都绑死在精心工程化的系统专属落地管线上。此前 agentic 系统的通行解法是把整个技能、控制器或 VLA 封装成可调用原语:模型决定"做什么",不透明执行器决定"怎么做",模型因此不对细粒度物理决策负责。
本文的目标是本文目标是设计一个"合适的接口":一个对 VLM 语义上自然可解释、又足够细粒度支撑直接物理控制的动作空间,让基础模型无需改动就能直接负责细粒度物理决策。具体拆成两个互补目标:(1)零样本(ZS)模式——不微调任何参数,直接让 Gemini-3.1 Pro 这类闭源前沿 VLM 通过接口操控真机,并随底层模型进步自动获益;(2)微调(FT)模式——在同一个动作空间里,仅用 164 条真机演示(约 7.8K 决策步)和几 GPU 小时,把 Qwen3.5-2B 这类小模型适配成可低成本部署的操作策略,并在受控对比中检验其相对 VLA 范式的泛化与 sim-to-real 能力。此外,作者希望这套动作空间同时可被人类直接操作,从而统一 VLM 智能体与 GUI 式人类控制,支撑无需专业遥操作硬件的低成本数据采集。
与已有工作不同的是,独特切入在于接口抽象层级的选择。计算机使用与游戏智能体早已证明:紧凑、可解释、人机都能操作的动作空间(鼠标、键盘、手柄)能让基础模型即插即用;导航领域也有离散方向原语的传统。但真实操作控制一直缺乏对应物——控制是本体专属、高维、且需要精细空间精度的。已有 agentic 系统的选择是"把怎么做藏起来":暴露 place(object, target) 这类高层技能或直接调用 VLA,抽象层级越高越可靠,但模型失去对细粒度物理的控制权。Show-Harness 反其道而行:直接暴露"怎么做"本身——细到单步运动的语义动作单元,而每个单元的物理实现是确定、透明的解释器映射,不是黑盒策略。动作表征消融(Figure 10)进一步揭示了这套设计的下限:即使换成无语义先验的任意符号,只要附上书面约定也能达到 95% 成功率,说明"明确约定 + 确定性落地"而非动作命名才是可靠性来源。
核心方法
直觉上,Show-Harness 把「控制机器人」重新表述为「让 VLM 在它天然理解的语义空间里做一连串小决策」:每步给模型多视角图像、本体感受状态和简短交互历史,模型从紧凑词汇表(六个平移方向、两个增量旋转、抓/放/完成)里选一个语义动作,本体专属解释器把它确定性地变成一小段受安全约束的机器人运动,再把新观测和执行反馈喂回下一轮。技术上这是一个感知-推理-动作闭环:给定指令 $\ell$,第 $t$ 步系统捕获观测 $o_t = (I_t, p_t)$,经推理插件集 $\mathcal{P}$ 精炼出上下文 $c_t = \Phi_{\mathcal{P}}(\ell, o_t, h_t)$;核心 VLM 选择语义动作 $a_t = \pi(c_t) \in \mathcal{A}$;解释器落地为控制 $u_t = g_E(a_t; s_t)$,执行后更新环境进入下一迭代。整个 harness 模型无关:ZS 模式直接套用前沿闭源模型(默认 Gemini-3.1 Pro),FT 模式用 rank-64 LoRA 微调 2B 小模型预测同样的语义动作 token。
核心创新是语义动作空间 $\mathcal{A}$ 的三性质设计。(i)增量式:每个单元只引起一次小的局部物理变化(平移默认 2cm/4cm、旋转 15°),模型通过可观察的动作后果保持在控制回路中,靠连续修正达成精细行为,甚至能不微调地切换步长粒度。(ii)可解释且本体无关:动作是语义符号而非数值目标,本体专属低层控制全部下放给解释器——按公式更新 6-DoF 位姿设定点 $s_{t+1} = \Pi_E\left(x_t + \sigma_t R_E d_a,\ \exp(\theta_t [R_E r_a]_\times) Q_t\right)$,校准增量 $\sigma_t, \theta_t$ 定幅值,$R_E$ 把语义方向映射到本体运动系,投影 $\Pi_E$ 强制工作空间和单步限位;Franka 用阻抗控制、AgileX 用逆运动学、仿真器执行操作空间命令,适配新本体只需写一个新解释器。(iii)视觉锚定:平移方向相对可观察的参考视角定义,空间推理可直接映射为动作。与已有方法的本质区别:技能调用范式里模型只决定「做什么」,这里模型对「怎么做」的每一步负直接责任。
方法步骤详情
系统按感知-推理-动作三阶段组织可配置插件(Table 1)。感知:多视角引导插件说明各相机角色与优先级(全局视角给场景上下文、腕部相机给细粒度对齐),本体感受插件把夹爪高度、接触与开合状态译成文本反馈。推理:子任务规划插件把指令分解为带「可目视验证完成条件」的有序子任务,执行中每步自查判据并推进;情境规划插件延迟不确定决策、等证据出现再解析;动作分块插件在目标尚远时一次输出短序列开环执行;自适应步长插件按目标可见性在 2cm 与 4cm 间切换。动作:动作历史携带最近 5 个动作并防振荡;失败恢复插件检测空抓后重置夹爪并回滚。两种模式共享接口:FT 模式在演示 $\mathcal{D}$ 上最小化 token 级交叉熵 $\mathcal{L}(\theta) = -\sum_{(\ell,o,h,a)\in\mathcal{D}} \log \pi_\theta\left(a \mid \Phi_{\mathcal{P}_{min}}(\ell,o,h)\right)$,只留指令、观测与短历史作上下文,动作经 VLM 原生词汇预测,无专用动作头。数据由 GUMI 界面采集:语义单元映射为按钮和按键,人用键盘、computer-use 智能体用浏览器操作同一界面,逐步记录 $(o_t, a_t)$ 对,支持双臂与人机接管。
技术新颖性
新颖性体现在四个层面。第一,接口粒度上的空白填补:介于「高层技能调用」与「低层 API 编程」之间,细粒度语义单元既保住 VLM 的空间推理能力,又让模型对物理执行负直接责任,不同于把执行交给不透明控制器的层级系统。第二,语义动作经 VLM 原生词汇预测(如 MV_FWD 就是普通 token),不需要动作头、特殊 token 或连续回归头,这使 rank-64 LoRA、约 3% 参数、几 GPU 小时的轻量适配成为可能,且 token 级监督天然继承语言模型的组合泛化——FT 在只见过 0° 和 45° 旋转演示时对未见的 90° 外推到 70%,而连续回归的 $\pi_{0.5}$ 只有 20%。第三,语义决策与度量执行分离:精度需求(2cm→1cm)通过解释器配置适配而无需重学,安全限位在执行前拦截。第四,GUMI 把同一动作空间暴露为 GUI,演示天然是策略可读的 $(o_t, a_t)$ 对并保留低层轨迹,可同时训练两类策略;同一批 164 条 episodes 跨 Franka 与 AgileX 复用,支持人类与前沿智能体混合采集,无需专业遥操作硬件。
实验结果
Table 2 三个泛化层级上,ZS(Gemini-3.1 Pro 零样本)与 FT(Qwen3.5-2B 微调)全面领先。跨任务:十个「物体→容器」真机任务上 ZS 平均 89%、FT 86%,对照 π0.5 39%、GR00T 35%、H-VLA 50%、G-VLA 13%、CaP-X 44%、RATS 57%;OOD 差距更大,Chess→Plate 上 ZS 10/10 而 GR00T、G-VLA 均 0/10。跨环境:四种扰动下 ZS 全部 20/20、FT 88%;sim-to-real 中 FT 仅用 230 条仿真演示达 13/20,π0.5 与 GR00T 均 0/20。跨本体:Franka 上 ZS 48/50、AgileX 上 45/50(平均 93%),FT 45/50 与 42/50(87%)。能力分析(Figure 6):步长 2cm→1cm 使 ZS 60%→82%、FT 40%→65%,同数据的 π0.5 仅 18%;旋转外推 FT 在未见 90° 达 70%;推理任务 ZS 加情境规划 85%、π0.5 为 0%;视频示教收纳 ZS 20/20。消融:去多视角引导 96%→58%、去子任务规划→60%、全程分块→74%;视觉提示把手柄抓取 40%→85%;动作表征语义名+约定 100%、无约定符号仅 1/20(Figure 10)。Figure 7/8 表明零样本性能随模型能力递增、2B 是微调最佳规模。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 十个真机抓放任务(5 物体 × 2 容器,各 10 次随机放置) | 平均成功率 | ZS 89% / FT 86% | π0.5 39%、GR00T 35%、H-VLA 50%、G-VLA 13%、CaP-X 44%、RATS 57% | 比最强基线 RATS 高 32 个百分点;OOD 棋子任务 10/10 对基线最高 4/10 |
| Sim-to-Real(仅用 230 条仿真演示训练,真机 Franka 评估 2 任务 20 次) | 成功率 | FT 13/20 | π0.5 0/20、GR00T 0/20 | 可训练 VLA 基线完全失败,本文方法可用 |
| 跨环境扰动(背景/光照/视角/干扰物,各 20 次) | 平均成功率 | ZS 100%(四项全部 20/20)、FT 88% | RATS 65%、H-VLA 63.8% | 零样本在所有扰动下满分,领先 35 个百分点 |
| 跨本体(Franka 7-DoF 与 AgileX 6-DoF,各 50 次) | 平均成功率 | ZS 93%(48/50、45/50)、FT 87% | RATS 52%、CaP-X 43%、π0.5 41% | 比最强基线高 41 个百分点,换本体仅需换解释器 |
| 精细操作(积木堆叠+插销,解释器步长 2cm→1cm) | 成功率 | ZS 60%→82%、FT 40%→65% | π0.5 18%(额外精细训练后 62%) | 免重训即超过基线重训后的水平 |
| 推理型任务(三杯寻物、拼字母 SHOW)与视频示教收纳 | 成功率 | ZS+情境规划 85%;视频示教 ZS 20/20、FT 95% | π0.5 0%(借 Gemini 子任务 5%);FT 单独 10% | 情境规划把 ZS 从 20%(无序收纳)提至满分;FT 借规划器 10%→70% |
局限与改进
作者承认的局限:目前只在带平行夹爪的单臂和双臂上评估,未覆盖人形或灵巧手等更复杂本体;感知侧缺少触觉、力反馈等具身模态,难以支持接触丰富和细粒度物理交互。我自己的观察:其一,逐步调用前沿 VLM 的延迟与成本不可忽视——动作分块消融显示全程开环会把成功率从 96% 拖到 74%,说明系统本质上仍需高频闭环,而高 thinking effort 会让 GPT-5.6-sol 墙钟时间膨胀 3.4 倍,对动态场景(如滚动的网球,ZS 也只有 7-8/10)尤为不利;其二,离散增量语义偏向位置控制,缺乏力/阻抗层面的表达,擦拭、按压等任务如何映射尚不清楚;其三,FT 模式仍受演示分布束缚:演示只含 3/5 物体、单一 2cm 步长,OOD 物体(Teddy 8/10、Chess 9/10)略低于域内,1B 级模型会在目标附近过度局部调整导致 episode 变长,sim-to-real 也只有 13/20;其四,episode 上限 50 步,部分消融中平均步数达 30-49 步,真实部署的时间经济性仍差;其五,视觉锚定依赖相机标定与视角一致性,自由移动基座等剧烈视角变化未验证。
独立分析的弱点
独立分析四个弱点。(1)推理成本与延迟:ZS 模式每 episode 平均约 30 步、每步都要调用一次前沿模型,API 延迟叠加后单任务可能耗时数分钟,最强模型在最高思考档位墙钟成本增 3.4 倍;改进方向是把动作分块升级为学习式的「何时停止」预测,或把前沿模型的逐步决策蒸馏进 2B 级小模型做边缘部署。(2)离散动作无法表达连续力控:GRASP 只有开/合两态,没有抓握力度、柔顺阻抗参数,面对易碎物、线缆、可形变物体(论文中毛绒熊已掉到 7-8/10)会受限;改进方向是在解释器侧引入力阈值与阻抗参数插槽,仍以语义符号暴露给模型。(3)接口有效性依赖书面约定而非动作命名:Figure 10 (D) 显示无约定时成功率仅 1/20、自推断映射正确率只有 23.3%,但论文未探讨约定如何自动生成与跨任务迁移;改进方向是从解释器代码自动生成约定文档。(4)FT 泛化天花板:演示规模仅 164 条、含 3/5 物体,精细任务显著依赖更大骨干(Figure 8),sim-to-real 近半失败;改进方向是利用 GUMI 做半自动规模化采集,并对失败 episode 在线修正。
未来方向
作者提出的方向:把框架扩展到人形、灵巧手等更复杂本体;在感知侧加入触觉和力反馈以支持接触丰富、更细粒度的物理交互。基于本文成果可自然延伸的方向:(1)与世界模型结合——语义动作是天然的世界模型动作 token,可用视频生成模型在语义空间做 rollout 预测,先仿真后执行以减少真机试错与步数开销;(2)GUMI 的远程与众包采集——界面纯数字化,可组织不在机器人现场的人类甚至 computer-use 智能体大规模产演示,把 164 条 episodes 的量级再提一两个数量级,并系统研究数据规模-泛化曲线;(3)分层动作词汇——在细粒度单元之上让解释器自动合成可复用的宏动作(如"接近直到目标入腕部视野"),平衡效率与粒度,缓解 30-49 步的步数经济性问题;(4)在线自适应步长——目前 1cm 精度靠手动改解释器配置,可让 VLM 按任务输出步长元动作或按视觉误差自动调度;(5)跨具身迁移的系统研究——同一批演示跨 Franka/AgileX 复用已初步验证,进一步可量化解释器参数差异对策略迁移的影响,迈向"采一次、处处用"的操作数据集与标准化本体解释器接口。
复现评估
复现条件较好。项目主页(showlab.github.io/Show-Harness)标注提供 Code & Model & Dataset;核心数据量不大:真机 164 条 episodes(7.8K 决策步,Franka 101 条 + AgileX 单臂 63 条)、仿真 230 条 episodes(13.5K 步,ManiSkill 与 RoboLab);FT 用单张 RTX 5090、rank-64 LoRA 只更新约 3% 参数、几 GPU 小时即可。门槛主要有二:其一,硬件需要 Franka Research 3 加 RealSense 双相机或双臂 AgileX 加三个 Orbbec 相机,ZS 模式还需前沿模型 API(默认 Gemini-3.1 Pro);其二,解释器标定参数(增量 $\sigma_t, \theta_t$、坐标映射 $R_E$、工作空间限位)是安全关键量,正文未给数值,需按附录 7.2 自行标定。评估协议清晰(每任务 10 次、50 步上限)但真机消融耗时较多。总体属「代码开源后中等难度」:软件栈与 FT 训练易复现,完整真机结论需机器人硬件和安全标定。
论文图表
论文首图(teaser),用一组真机任务照片展示系统能力覆盖面:块体下猜杯、擦除单词、双臂折布、双臂笔入笔筒、切蛋糕、清理桌面等,横跨不同任务类型、场景条件和机器人本体,并点明两条使用路径——前沿模型直接零样本部署、小模型轻量适配后高效控制。
一眼建立对论文贡献范围的整体认知:这不是单一任务的技巧,而是一个跨任务、跨场景、跨本体的通用接口主张,是读者判断论文价值的第一入口。