Show-Harness
Show-Harness 硅基写手深入解析 Show-Harness 如何以离散语义动作、具身解释器和可插拔闭环,让前沿 VLM 零样本控制机器人,并用少量示范微调 2B 模型;结合真实机器人、跨环境、跨本体和消融实验,审视其泛化证据、安全边界与工程价值。
自动研究时间:2026-09-11 09:02(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Sep 10,列表最顶部为 Show-Harness: Just a VLM Agent Can Play Robots。
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> arXiv v1 全文 PDF 与附录 -> 官方项目页、代码、模型和数据页面。
执行摘要
机器人基础模型长期面对一个接口难题:通用 VLM 擅长识别物体、理解空间关系和拆解任务,却不能直接输出不同机器人的电机或末端执行器指令;VLA 把视觉、语言直接映射为连续动作,控制紧凑,却需要大量本体相关轨迹;Agent 系统保留了 VLM 的推理能力,但常把真正的物理执行交给技能库、轨迹优化器或另一套 VLA。Show-Harness 的选择是在高层技能与低层连续控制之间插入一个离散、细粒度、可读的语义动作层。
模型每一步只输出 MV_FWD、MV_LEFT、ROTATE_CW、GRASP、RELEASE、DONE 等动作单元。本体解释器再把它确定性地转换为 Franka、AgileX 或模拟器的局部位姿变化,并用工作空间、桌面高度和单步幅度约束阻断越界动作。这样,VLM 仍负责“向哪边移动、何时抓取、是否完成”等细粒度决策,而机器人差异被收敛在解释器中。
同一接口支持两种模式。零样本模式直接调用前沿闭源 VLM,在完整的感知—推理—动作插件链中闭环控制;微调模式以 GUMI 浏览器界面收集 (观察, 语义动作) 数据,只给小型开源 VLM 加 LoRA,让它用原生词表预测一个动作 token。默认 Qwen3.5-2B 只更新约 3% 参数,在单张 H200 上不到 2 小时完成微调。GUMI 同时保留低层轨迹,因此同一批演示可训练语义策略与连续控制基线。
主实验使用 Franka Research 3 与双臂 AgileX。十个物体—容器任务上,Show-Harness 的零样本和微调模式平均成功率分别为 89% 和 86%;六类基线为 13%–57%。跨环境平均分别为 100% 和 88%,跨本体平均为 93% 和 87%。仅用模拟数据训练时,微调模式在真实 Franka 上达到 13/20,而同数据训练的 与 GR00T 均为 0/20。这些结果支持“语义动作与度量执行解耦”有助于迁移,但不能证明它已经替代大规模 VLA:任务仍以桌面 pick-and-place 为主,试验数不大,零样本模式依赖昂贵 API,且完整系统包含多个人工设计插件和本体校准。
论文最有说服力的不是单一榜单,而是针对接口机制的实验:把步长从 2 cm 改为 1 cm、组合对角动作、加入旋转单元,都无需重训;明确写出动作约定时,即使把动作名改成任意字母也能达到 95%,而不给约定的任意符号仅成功 1/20。这说明优势主要来自明确、稳定、可观察的动作契约,语义名称只是有益先验。对具身系统而言,这是一条重要工程启示:模型能力之外,接口本身就是可优化的智能放大器。
1. 论文基本信息
| 项目 | 内容 |
|---|---|
| 论文标题 | Show-Harness: Just a VLM Agent Can Play Robots |
| 论文编号 | arXiv:2609.10522 |
| 当前版本 | v1,2026-09-09 提交,30 页(含附录) |
| 主分类 | Robotics(cs.RO) |
| 其他分类 | Artificial Intelligence(cs.AI)、Computer Vision and Pattern Recognition(cs.CV)、Multimedia(cs.MM) |
| 作者 | Yanzhe Chen、Zechen Bai、Zhijun Cao、Wenzheng Zeng、Kevin Qinghong Lin、Yiqi Lin、Guoqiang Liang、Kevin Yuchen Ma、Qiming Huang、Mike Zheng Shou |
| 机构 | Show Lab,National University of Singapore |
| 核心系统 | Show-Harness;GUMI |
| 机器人平台 | Franka Research 3;AgileX Piper 单臂/双臂;ManiSkill 与 Isaac Lab/RoboLab 模拟环境 |
| 默认模型 | 零样本:Gemini-3.1 Pro;微调:Qwen3.5-2B |
| 开源状态 | 代码、训练流程、Apache-2.0 许可证、六个 LoRA adapter 与演示数据已发布 |
核心链接:
- Hugging Face 详情页:https://huggingface.co/papers/2609.10522
- arXiv 摘要页:https://arxiv.org/abs/2609.10522
- arXiv PDF:https://arxiv.org/pdf/2609.10522
- arXiv 完整源码:https://arxiv.org/e-print/2609.10522
- 官方项目页:https://showlab.github.io/Show-Harness/
- 官方代码:https://github.com/showlab/Show-Harness
- Hugging Face 模型:https://huggingface.co/showlab/Show-Harness-VLMs
- Hugging Face 数据集:https://huggingface.co/showlab/Show-Harness-Data
2. 背景与动机:机器人缺的可能不是更大模型,而是更好的接口
2.1 VLA 路线:控制直接,但语义被压进连续动作
VLA 把图像、语言指令和机器人状态直接映射为连续动作 chunk、离散电机 token、关键帧或 latent action。它的优点是端到端,训练目标与执行信号直接对应;缺点是动作分布与机器人本体、相机、工作空间和数据采集方式紧密绑定。换机械臂、末端执行器或任务精度时,往往需要重新采集轨迹和适配策略。
论文将这一问题描述为“用语义换控制”:VLM 原有的开放世界知识被压缩进不透明的 sensorimotor mapping,迁移能力受训练分布约束。、、GR00T、RT-1 和 OpenVLA 都属于这一大方向,只是在动作表示、训练规模和通用化策略上不同。
2.2 Agent 路线:保留推理,但模型未必直接负责物理细节
另一类系统让 VLM 输出子目标、关键点、value map、代码或技能调用,再由控制器、规划器或 VLA 执行。SayCan、Code as Policies、RoboScript、Goal-VLA、Harness VLA 等工作证明了分层架构的有效性,但也形成“orchestration gap”:模型决定做什么,真正怎样移动则由下游黑盒决定。
Show-Harness 试图在两端之间找一个窄腰接口:
- 比
place(object, target)更细,使 VLM 对每个物理步骤负责; - 比 6-DoF 数值控制更语义化,使预训练 VLM 无需先学机器人坐标;
- 对人和模型都可操作,使数据采集、零样本 Agent 和微调策略共用同一动作空间;
- 把本体差异留给确定性解释器,而不是让模型重复学习。
这一思路与 computer-use、游戏手柄和离散导航接口相似:当动作集合紧凑、可解释、反馈及时,通用模型可以直接在环境中闭环行动。论文的贡献是把这一原则推进到需要厘米级精度的真实机械臂操作。
3. 核心贡献
3.1 细粒度语义动作层
默认动作集合 包括:
| 类型 | 动作单元 | 含义 |
|---|---|---|
| 平移 | MV_FWD/BACK、MV_LEFT/RIGHT、MV_UP/DOWN | 相对当前参考视角,末端执行器沿一个方向移动一步 |
| 旋转 | ROTATE_CW/CCW + 轴 | 绕指定轴增量旋转 |
| 夹爪 | GRASP、RELEASE | 闭合或打开夹爪 |
| 终止 | DONE | 声明任务完成 |
动作设计有三个原则:
- 增量式:每一步只产生小范围变化,模型可观察后果并持续修正;
- 可解释且与本体无关:模型输出符号,不接触关节角、力矩或具体坐标;
- 视觉对齐:方向相对可见视角定义,降低图像空间到机器人坐标的推理负担。
“与本体无关”并不等于零本体工程。每个机器人仍需要编写和校准解释器、运动坐标映射、安全边界及底层控制器。论文的更准确主张是:本体适配从模型训练问题变成了显式的软件与控制接口问题。
3.2 确定性本体解释器
在时间步 ,VLM 根据指令 、多视角图像 、本体状态 与短期历史 选择语义动作:
解释器 再根据本体 和内部 setpoint 生成低层控制:
对于位移动作,它更新 6-DoF 笛卡尔位姿,并通过投影 强制执行工作空间、桌面高度、单步平移和旋转限制。Franka 使用笛卡尔 setpoint 与 impedance control;AgileX 使用 inverse kinematics 与流式关节目标;模拟器使用对应的 operational-space command。
这种确定性有两层意义:一是动作执行结果更容易追踪和调试;二是同一个语义 token 的物理含义不会随策略网络内部状态漂移。但实际运动仍受标定误差、控制延迟、接触动力学和视觉遮挡影响,“确定性 grounding”不等于真实世界结果完全确定。
3.3 可插拔的感知—推理—动作闭环
Show-Harness 不只是动作字典,还提供围绕动作接口的 Agent harness:
| 阶段 | 插件 | 作用 |
|---|---|---|
| 感知 | Multi-View Guidance | 告诉模型全局相机与腕部相机各自适合判断什么 |
| 感知 | Proprioception | 把夹爪高度、位移、接触和夹爪状态转成文本反馈 |
| 推理 | Subtask Planning | 拆成带可视完成条件的子任务 |
| 推理 | Situated Planning | 把信息不足的分支留到执行过程中再决策 |
| 推理 | Action Chunking | 目标较远时一次输出短动作序列,减少模型调用 |
| 推理 | Adaptive Step | 远处使用大步长,近处切换小步长 |
| 推理 | Visual Prompt | 用额外模型调用标出难以语言描述的 affordance |
| 动作 | Action History | 保留最近动作,抑制左右或前后振荡 |
| 动作 | Failure Recovery | 检测空抓,重置夹爪并回滚到抓取子任务 |
插件化使系统能针对任务按需增加计算。例如 Situated Planning 和 Visual Prompt 默认关闭,只在隐藏物体或把手抓取等专门场景启用。这也提醒读者,论文成绩属于“VLM + 动作接口 + 插件 + 本体解释器”的完整系统,不能全部归因于基础模型或动作字典中的任一单项。
3.4 一个接口,两种模型模式
**零样本模式(ZS)**保留完整前沿 VLM,通过 API 读取图像、计划子任务并逐步输出动作。它无需机器人轨迹训练,能够继承更强基础模型的视觉和推理能力,但每个 episode 可能需要几十次多模态调用,延迟、费用与云端可用性不可忽略。
**微调模式(FT)**用演示数据训练小型开源 VLM 直接预测动作 token。训练目标是标准 token-level cross entropy:
只保留指令、多视角观察和短动作历史。动作来自模型原生词表,不增加 action head 或特殊 token。默认 Qwen3.5-2B 对语言模型线性层使用 rank-64 LoRA,冻结视觉编码器和 multimodal projector,只更新约 3% 参数。
3.5 GUMI:把控制界面同时变成数据接口
GUMI 为每个语义动作绑定按钮和按键。人类可像玩游戏一样在浏览器中操控机械臂,computer-use Agent 可点击同一 GUI,通用 VLM 也可直接产生同名动作。每步记录执行前观察和动作,形成可训练样本;解释器还可同步保存连续位姿和关节轨迹。
它解决了三个常见数据问题:
- 不依赖 VR、leader arm 等专用遥操作硬件;
- 同一数据可训练离散语义策略,也可转换给连续 VLA 基线;
- 人类可中途接管 Agent rollout,收集恢复行为而非只保留成功轨迹。
不过,键盘遥操作把高带宽连续控制压缩成离散点击,采集效率与复杂接触任务的表达力尚未与成熟遥操作系统系统比较。远程操作还需要独立处理网络延迟、访问控制和物理安全,浏览器可达并不自动意味着生产安全。
4. 实验设置
4.1 硬件与观察
- Franka Research 3:7-DoF 单臂,Intel RealSense D435 外部视角与 D405 腕部视角;
- AgileX Piper:两个 6-DoF 机械臂,三个 Orbbec Dabai DC1 相机,包括一个共享全局视角和两个腕部视角;
- 本地推理:单张 RTX 5090;前沿模型通过 API;
- 夹爪:两套真实平台均为 parallel-jaw gripper。
4.2 主任务、数据与指标
十个真实机器人主任务由五种物体与 plate/bowl 两种容器组合而成:block、banana、tennis ball、teddy bear 和 chess piece,覆盖规则刚体、不规则形状、滚动、可变形与精细抓取。微调数据只包含前三种物体,teddy bear 和 chess piece 留作 OOD 测试。
默认每个任务随机放置物体并运行 10 次,episode 最多 50 步;超时计失败。指标为成功率和每个 episode 的平均步数。
演示语料如下:
| 平台 | 任务数 | Episode | 决策步 | 平均步/Episode |
|---|---|---|---|---|
| Franka 真实机器人 | 9 | 101 | 4,969 | 49.2 |
| AgileX 真实机器人 | 10 | 63 | 2,805 | 44.5 |
| 真实数据合计 | 19 | 164 | 7,774 | 47.4 |
| ManiSkill | 1 | 100 | 5,840 | 58.4 |
| RoboLab | 12 | 130 | 7,683 | 59.1 |
| 模拟数据合计 | 13 | 230 | 13,523 | 58.8 |
其中 19 个 Franka episode、594 步专门记录空抓后的恢复。微调使用 7.9K 单臂样本训练 40 epoch,学习率 、cosine schedule、warmup ratio 0.1、bf16、双路 256×256 图像、有效 batch size 32。Qwen3.5-2B 在单张 H200 上耗时不到 2 小时,24 GB 级 GPU 也可容纳该训练配置。
4.3 对照组
论文比较三类系统:
| 路线 | 代表方法 | 物理动作由谁决定 |
|---|---|---|
| 端到端 VLA | 、GR00T | 训练后的 VLA 直接输出低层连续动作 |
| VLA-centric Agent | Harness VLA、Goal-VLA | 外层 Agent 规划,VLA 是主要执行器 |
| Code-as-policy Agent | CaP-X、RATS | VLM 生成程序或 API 调用,由控制栈执行 |
| Show-Harness | ZS、FT | VLM 逐步选择语义动作,解释器确定性落地 |
为控制数据变量, 和 GR00T 使用从同一批 GUMI 演示转换出的连续末端轨迹;Show-Harness FT 与这些 VLA 也共同使用两个真实本体的数据。这个对照比跨论文榜单更有解释力,但各方法的预训练规模、结构先验和适配方式仍不同,不能视为完全等容量实验。
5. 核心实验结果
5.1 跨任务:语义接口对未见物体仍保持较高成功率
| 方法 | GR00T | H-VLA | G-VLA | CaP-X | RATS | ZS | FT | |
|---|---|---|---|---|---|---|---|---|
| 十个任务平均成功率 | 39% | 35% | 50% | 13% | 44% | 57% | 89% | 86% |
对微调时未出现的 teddy bear 和 chess piece,ZS 四项 object–receptacle 组合达到 8/10 至 10/10,FT 达到 7/10 至 9/10。相比之下,六个基线多数落在 0/10 至 6/10。结果说明开放 VLM 的视觉先验和语义动作层能复用到新物体,但这里的 OOD 仍是同一桌面、同类抓取流程中的物体变化,不等于跨技能泛化。
5.2 跨环境与 sim-to-real
| 方法 | GR00T | H-VLA | G-VLA | CaP-X | RATS | ZS | FT | |
|---|---|---|---|---|---|---|---|---|
| 背景、光照、视角、干扰物平均 | 40.0% | 34.0% | 63.8% | 15.0% | 52.5% | 65.0% | 100.0% | 95.0% |
| Sim-to-real | 0/20 | 0/20 | 未报告 | 未报告 | 未报告 | 未报告 | 不适用 | 13/20 |
| 含 sim-to-real 的论文汇总平均 | 40.0% | 34.0% | 63.8% | 15.0% | 52.5% | 65.0% | 100.0% | 88.0% |
表中 95.0% 是由 FT 在四类真实环境偏移中的 18/20、19/20、19/20、19/20 计算所得;论文表格的 88.0% 还纳入了 13/20 的 sim-to-real。ZS 没有训练阶段,因此论文没有为它定义 sim-to-real 项。
同样是模拟演示,FT 能迁移到真实 Franka,而连续 VLA 对照为零,支持离散语义动作降低了渲染和本体差异的影响。但该结论只有 20 次真实测试、单一 sim-to-real 设置;需要更多对象、相机、动力学与随机种子才能判断稳定性。
5.3 跨本体
| 方法 | GR00T | H-VLA | G-VLA | CaP-X | RATS | ZS | FT | |
|---|---|---|---|---|---|---|---|---|
| Franka | 44% | 38% | 52% | 14% | 46% | 60% | 96% | 90% |
| AgileX | 38% | 34% | 46% | 8% | 40% | 44% | 90% | 84% |
| 平均 | 41% | 36% | 49% | 11% | 43% | 52% | 93% | 87% |
ZS 切换机械臂只更换解释器;FT 则在两个本体的演示上联合训练后直接测试。二者不是同一种“零样本跨本体”:ZS 更接近接口级迁移,FT 仍看过两个本体的数据。因此不能从 87% 推出小模型对完全未见本体也能零样本迁移。
5.4 精度、旋转、工作空间与双臂协调
- 精细控制:把解释器步长从 2 cm 改成 1 cm,不改接口也不重训,block stacking 与 peg insertion 的 ZS 从 60% 提升到 82%,FT 从 40% 提升到 65%。 用同等数据为 18%,加入更细粒度训练后才到 62%。
- 动作组合:将两个正交平移组合成一次对角位移,ZS 和 FT 的平均步数分别降低 26% 和 24%,成功率基本不降。
- 旋转外推:每个旋转单元为 15°。FT 只看过 0° 和 45° 胡萝卜抓取,在未见的 90° 达到 70%; 为 20%。
- 工作空间偏移:从训练中心区域扩展到靠近边界的 90% 工作区时,ZS 从 98% 降到 92%,FT 从 96% 降到 88%, 从 48% 降到 24%。
- 双臂协调:在 tidy the table 与 pass the banana 两个 20-trial 任务中,联合预测双臂动作优于两个独立 Agent,并把碰撞降至零。说明共享的联合动作决策能显式处理手臂间依赖。
这些实验共同支持“改变动作解释比重训策略便宜”的主张。需要注意,动作组合和步长切换仍由人预先设计并校准;论文证明了可插拔性,并未证明系统能自主发现新的安全动作原语。
5.5 语义推理与视频上下文学习
在“寻找三个杯子下的积木”和“把字母排成 SHOW”两个推理密集任务中:
- ZS + Situated Planning 达到 85%;
- FT 单独为 10%, 单独为 0%;
- 给 FT 和 同样的 Gemini 子任务指令后,FT 升到 70%, 仅到 5%。
这表明小型 VLM 虽不具备同等高层规划能力,却能执行新颖语义子任务;连续动作模型更难从语言计划直接映射到未见物理序列。
视频 in-context learning 要求按人类或机器人示范的顺序收纳三个物体。只给含糊的 tidy up 指令时 ZS 为 20%;加入任一来源的视频示范后均为 20/20。FT 使用同一 planner 提取的任务提纲后达到 95%。这里展示的是从视频读取顺序并执行,不应外推为任意技能模仿或一次示范学习连续动力学。
6. 消融揭示了真正起作用的机制
6.1 模型更强主要改善物理 grounding,而不是动作格式
五个前沿 VLM 在五项 plate 任务上的成功率总体随基础能力提高。增加 thinking effort 主要减少冗余步骤,对成功率提升有限,却可能显著增加墙钟成本;论文给出的 GPT-5.6-sol 例子达到 3.4 倍延迟。所有模型超过 98% 的回答都能生成合法动作单元,说明格式遵循不是主要瓶颈,误差更多集中在精细抓取和放置。
在 chess-cannon 任务中,规划正确率高于精细 grounding 指标,给出目标 bounding box 后性能继续提升。这进一步说明当前系统的瓶颈不是“是否理解任务”,而是视觉深度、接触位置和末端执行器对齐。
6.2 2B 是论文设置下的容量甜点
Qwen3.5、InternVL 和 Gemma 系列的微调实验显示,2B 及以上模型在普通 plate 任务已较强;更大模型主要改善 stacking 和 peg insertion。1B 级模型容易在目标附近反复微调,episode 更长;但较小模型在会滚动的 tennis ball 上有时优于大模型,因为响应延迟更低。
因此“更大 VLM 更会控制机器人”并不完整。精度受视觉与模型容量影响,动态目标又受推理延迟影响,部署要在感知精度、动作频率和成本之间联合优化。
6.3 插件并非装饰,而是主要性能来源之一
在真实 Franka 上用 Gemini-3.1 Pro 做 leave-one-out:
| 插件变化 | 结果与解释 |
|---|---|
| 只用全局视角 | 成功率从 96% 降至 58%;腕部视角对小物体对齐关键 |
| 去掉 Proprioception | 成功率从 96% 降至 68%;高度、接触、夹爪状态补足视觉歧义 |
| 去掉 Subtask Planning | 成功率从 96% 降至 60%;常见错误是不抬起物体就向目标拖动 |
| 关闭 Action Chunking | 成功率仍为 96%,模型调用从 26 增到 32;始终 chunk 则调用降到 20,但成功率降至 74% |
| 只用固定细步/粗步 | 细步精确但易超时,粗步更快但易越过目标;自适应为 96%、平均 30 步 |
| 启用 Visual Prompt | 常规任务影响很小,把手抓取从 40% 升到 85% |
| 启用 Situated Planning | 常规任务影响很小,隐藏物体搜索从 35% 升到 85% |
| 去掉 Action History | 成功率下降、超时增加,主要是相反方向来回振荡 |
| 去掉 Failure Recovery | 成功率降至 72%,空抓后仍继续搬运是主要故障 |
这组实验是论文的重要价值:它把机器人 Agent 的“harness”拆成可验证模块。与此同时,多个插件会增加 prompt、状态工程和额外模型调用;论文没有完整报告每种配置的 API token、端到端延迟和单次成功成本。
6.4 明确动作契约比动作名字更重要
作者对六个平移动作做 2×2 消融:
| 动作名 | 书面约定 | 成功 | 平均步数 |
|---|---|---|---|
| 语义名称 | 有 | 20/20 | 25 |
| 语义名称 | 无 | 18/20 | 34 |
| 任意字母 | 有 | 19/20 | 27 |
| 任意字母 | 无 | 1/20 | 49 |
任意符号只要附带清楚的物理效果,几乎追平默认设置;反过来,模型试图仅从前后图像推断未知符号时,映射正确率只有 23.3%,略高于六方向随机猜测的 16.7%。结论不是“自然语言动作名没有用”,而是:显式 convention 提供主要 grounding,语义名称则减少认知与搜索成本。
7. 局限与批判性分析
7.1 任务覆盖与“通用机器人控制”之间仍有距离
论文主体集中在单臂/双臂、parallel-jaw gripper、桌面 pick-and-place。定性案例加入开抽屉、切蛋糕、叠放和字母排列,但没有大规模统计覆盖柔性物体操作、工具使用、移动底盘、动态人机协作、高速动作、精密装配或长时任务。作者也明确承认尚未验证 humanoid 和 dexterous hand。
所以当前证据支持的是“一个语义接口可跨若干机械臂和桌面场景复用”,而不是“一套动作词表已经覆盖通用具身智能”。本体越复杂,离散原语的组合长度、接触状态和并行动作空间都会快速增长。
7.2 安全层是边界约束,不是完整安全保证
解释器会阻断越过工作空间或桌面高度的命令,这是必要的防线;但它没有覆盖碰撞预测、速度与力矩限制、人类进入工作区、工具锐边、物体破损、语义误识别、网络/API 故障和多臂死锁等风险。论文报告的 failure recovery 主要针对空抓,不是通用异常恢复。
面向真实部署,至少还需要独立的实时 safety controller、碰撞与力阈值、急停、超时、权限隔离、动作审计和风险分级。VLM 不应成为唯一安全决策者。
7.3 感知模态仍不足以处理接触密集任务
系统主要使用 RGB 图像与文本化本体状态,没有触觉和力反馈。视觉可以判断位置,却很难可靠估计夹持力、滑动、卡住、柔性形变和接触稳定性。论文也把 tactile/force modality 列为未来方向。对于插入、旋拧、装配和精细双手操作,这不是小功能缺失,而可能是决定任务是否可解的观测边界。
7.4 API 模式的实时性、成本和可复现性未充分量化
零样本模式每次动作都可能调用闭源多模态模型。Action Chunking 能减少调用,但过度 chunk 会牺牲闭环反馈。论文报告了步数和部分模型调用次数,却没有系统给出每个任务的 token、端到端秒数、API 费用、网络抖动、限流影响与模型版本漂移。
闭源 VLM 更新后,完全相同的 prompt 也可能改变空间判断或工具调用行为。生产部署需要固定版本、回归轨迹集、延迟预算与降级策略,不能只依据平均成功率。
7.5 样本量与统计报告仍有限
主任务通常每项 10 次,跨环境场景每项 20 次。论文主要报告成功计数,缺少置信区间、跨随机种子方差和逐任务时间分布。10/10 并不意味着真实成功率为 100%;对安全关键系统,小样本中的零失败不足以证明可靠性。
此外,评测是作者自建任务与硬件,尚无第三方重复。公开代码和数据显著提高了可复现性,但机器人标定、相机位置、物体材质和底层控制器差异仍可能影响结果。
7.6 “跨本体复用”的成本被转移而非消除
新本体无需重训 VLM,但必须实现 、校准方向矩阵、步长、安全投影、夹爪控制和观测格式。对于标准机械臂,这可能比采集大规模轨迹便宜;对于腿足、人形或灵巧手,解释器本身可能接近一套复杂控制系统。
因此应比较的是总适配成本:解释器工程、标定和测试,与 VLA 数据采集、训练和验证各需多少人时、机器人时与算力。论文没有给出这一成本核算。
7.7 语义离散化也会带来效率上限
细粒度离散动作提升了可解释性与迁移,却可能产生很长轨迹,尤其当步长很小时。Action Chunking 与对角组合部分缓解了问题,但动作集合越丰富,模型选择难度和安全验证复杂度也会增加;动作集合越小,路径又越冗长。
一种潜在方向是分层接口:高层保持语义与可验证性,低层由短时、带约束的局部策略执行,并允许模型根据不确定性选择闭环频率。不过这会重新引入“谁负责 how”的边界,需要新的归因实验。
8. 相关工作与论文定位
8.1 端到端 VLA
- RT-1、OpenVLA、、、GR00T N1:从视觉与语言预测低层动作,依靠大规模机器人数据学习跨任务能力。Show-Harness 不学习统一连续控制器,而是让 VLM 输出可读动作,再由解释器落地。
- Universal Actions 等动作 token 化工作:也试图构造跨本体动作表示。Show-Harness 的区别在于动作 token 就是基础模型可理解的普通语义词元,并同时作为人机 GUI 控件。
8.2 VLM 作为中间决策者
- SayCan 让语言模型在技能可供性约束下选择高层技能;
- Code as Policies、RoboScript、CaP-X 让模型生成代码或组合 API;
- VoxPoser 等空间表示方法 让模型产生 value map、关键点或几何约束。
这些方法通常把物理细节交给下游控制器。Show-Harness 则把动作粒度压到一次小位移或一次夹爪操作,使 VLM 更直接地承担控制决策。
8.3 VLA-centric Agent 与 harness
- Goal-VLA 使用图像生成式 VLM 作为 object-centric world model;
- Harness VLA 用记忆与 Agent 层引导冻结 VLA 的 manipulation primitive;
- RATS / Playful Agentic Robot Learning 用 Agent 交互与程序化控制完成机器人任务。
Show-Harness 与这些工作一样重视闭环规划、反馈和恢复,但它把 VLA/技能库从必需的执行核心中移除。论文表格中 H-VLA 为最强 VLA-centric 对照,RATS 为最强 code-as-policy 对照;Show-Harness 的主实验平均仍领先。
8.4 Digital Agent 与 minimal interface
computer-use、游戏和导航 Agent 已表明,鼠标、键盘、手柄或离散方向等 minimal interface 能让通用模型利用预训练知识。Show-Harness 可以看作这一思想的物理延伸:关键不是模拟完整电机控制,而是找到足以组合出复杂行为、又能被模型可靠理解的最小动作协议。
9. 应用与工程影响
9.1 低数据、异构机械臂部署
实验室或中小型自动化团队往往有多种机械臂,却没有足够数据为每台设备训练大型 VLA。Show-Harness 提供一种可行路径:先实现经过安全审查的解释器,用前沿 VLM 快速验证任务,再用 GUMI 收集少量本地演示,把策略蒸馏到 2B 模型降低在线成本。
适合的初始场景是速度较低、工作空间有限、物体清楚可见且失败可恢复的桌面操作,例如分拣、取放、简单上架和实验室样本搬运。
9.2 人机协同数据飞轮
GUMI 让人类、GUI Agent 和 VLM 共用动作空间,天然支持“Agent rollout—人类接管—记录恢复—继续微调”的闭环。特别是空抓恢复数据,比只收集理想成功轨迹更能改善真实部署。
工程上应给每一步附加更多上下文:操作者身份、模型版本、解释器版本、校准参数、安全拦截、接管原因和任务结果。否则相同动作 token 在系统升级后可能不再具有完全相同的数据语义。
9.3 具身系统的接口标准化
这项工作最可能产生长期影响的部分,不是某个具体成功率,而是 model-facing action contract。若不同硬件厂商为常见局部运动、夹爪和安全状态提供一致语义 schema,上层 VLM、数据集、评测和 Agent harness 就能更容易复用。
标准化仍需解决单位、参考坐标、能力查询、执行确认、失败码、并发动作与安全等级。Show-Harness 提供了一个小而清晰的原型,但离跨厂商协议还有距离。
9.4 可观察、可审计的机器人 Agent
相比连续动作向量,MV_LEFT、GRASP 和 DONE 更容易写入日志、回放和解释;确定性解释器也便于定位“模型决策错”还是“执行层错”。这对事故调查、数据治理和回归测试很重要。
可审计不等于可证明安全。有效做法是同时记录:模型输入视图、语义动作、解释后 setpoint、低层执行反馈、安全拦截和最终环境变化,形成跨层 trace。
10. 结论
Show-Harness 提出了一条不同于“继续扩大机器人数据和端到端动作模型”的路线:把 VLM 已有的视觉、语言和规划能力,通过一个离散、增量、可解释的动作接口接入真实控制。论文用两类机械臂、模拟到真实迁移、跨环境测试和细致消融证明,这个接口确实能放大基础模型能力,并允许少量 LoRA 训练的小模型继承相当一部分效果。
最值得记住的结论有三点:
- 具身智能的瓶颈不仅是模型和数据,也可能是 model-to-world interface;
- 显式动作约定、闭环反馈、多视角和恢复机制共同决定可靠性,不能把结果简化成“VLM 会控制机器人”;
- 将本体差异放进确定性解释器能显著减少重训需求,但没有消除控制工程、标定和安全验证。
这篇论文证明了 Show-Harness 是一个有竞争力、已开源的桌面机械臂 Agent 框架。它尚未证明离散语义动作可以覆盖灵巧手、人形、接触密集与高速控制,也没有给出生产级安全和成本数据。下一阶段最关键的验证,是第三方在未见机器人和更复杂技能上复现,并以端到端时间、费用、失败严重度和总适配成本,而不只是成功率,比较语义 harness 与大规模 VLA。
参考资料
- Chen et al., Show-Harness: Just a VLM Agent Can Play Robots:https://arxiv.org/abs/2609.10522
- Hugging Face Daily Paper 详情页:https://huggingface.co/papers/2609.10522
- Show-Harness 官方代码与复现说明:https://github.com/showlab/Show-Harness
- Show-Harness 模型集合:https://huggingface.co/showlab/Show-Harness-VLMs
- Show-Harness 演示数据:https://huggingface.co/showlab/Show-Harness-Data
- Black et al., : A Vision-Language-Action Flow Model for General Robot Control:https://arxiv.org/abs/2410.24164
- Bjorck et al., GR00T N1: An Open Foundation Model for Generalist Humanoid Robots:https://arxiv.org/abs/2503.14734
- Brohan et al., RT-1: Robotics Transformer for Real-World Control at Scale:https://arxiv.org/abs/2212.06817
- Kim et al., OpenVLA: An Open-Source Vision-Language-Action Model:https://arxiv.org/abs/2406.09246
- Ahn et al., Do As I Can, Not As I Say: Grounding Language in Robotic Affordances:https://arxiv.org/abs/2204.01691
- Liang et al., Code as Policies: Language Model Programs for Embodied Control:https://arxiv.org/abs/2209.07753
- Chen et al., Goal-VLA: Image-Generative VLMs as Object-Centric World Models Empowering Zero-Shot Robot Manipulation:https://arxiv.org/abs/2506.23919
- Zhang et al., Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents:https://arxiv.org/abs/2607.08448
- Zhang et al., Playful Agentic Robot Learning:https://arxiv.org/abs/2606.19419