新加坡国立大学:Show‑Harness,一个接口,直接让VLM操控实体机器人
设计一个恰当的接口就能让现成的VLM直接、精细地操控机器人。——接口即能力目录01 Show‑Harness核心系统设计语义动作接口 模块化插件 GUMI数据采集面向VLM的物理可落地语义动作接口感知‑推理‑行动全套可配置插件GUMIGUI式操纵采集界面摆脱专业遥操作硬件02 实验03 语义动作接口控制机器人新加坡国立大学Show Lab团队提出Show‑Harness一套模型无关的具身适配框架。它不改动VLM内部权重而是设计一套离散的语义动作单元接口让VLM直接做细粒度物理决策既可以直接调用闭源前沿VLM实现零样本机器人控制也能仅用数小时GPU算力微调小参数量开源VLM完成低成本部署。▲图Show‑Harness跨多样任务、场景与机器人本体实现可泛化的具身操纵支持前沿模型零样本部署、小尺寸开源模型轻量适配01 Show‑Harness核心系统设计语义动作接口 模块化插件 GUMI数据采集整套系统由三部分组成面向VLM的语义动作空间、感知‑推理‑行动全套可插拔插件、GUMI GUI操纵演示界面。▲图Show‑Harness通过一套语义动作接口连接基础VLM与多样机器人本体实现前沿模型零样本控制与小型开源模型轻量适配面向VLM的物理可落地语义动作接口这套共享动作空间A由一组离散语义符号构成平移MV_FWD/MV_BACK/MV_LEFT/MV_RIGHT/MV_UP/MV_DOWN旋转ROTATE_CW / ROTATE_CCW夹爪GRASP / RELEASE任务结束DONE。简单理解VLM不需要输出“末端X增加0.02米”这种硬件专属数字只输出语义指令“向前移动一步”。▲图Show‑Harness 架构模块化感知‑推理‑行动循环通过共享的语义动作接口连接基础 VLM 到机器人控制这套动作设计满足三个关键属性增量式每一次动作只会产生一小段局部运动模型可以根据视觉反馈一步一步迭代修正同时支持动态调整步长远距离用大步靠近目标切换小步。本体无关全部是语义符号和机械臂关节数量、机械结构无关不同机器人只需要实现对应的解释器不需要修改给VLM看的动作词汇。视觉锚定移动方向基于相机观测视图定义VLM依靠图像就可以推理应该选择哪个动作。语义动作输出之后交给本体专属解释器确定性转换为该机器人可执行的笛卡尔位姿更新。解释器内部会做工作空间限位、安全边界拦截防止生成物理上非法的运动。不同机械臂比如Franka、AgileX双臂只需要替换解释器上层VLM推理逻辑完全不变。解释器拿到“MV_FWD”结合当前机器人位姿按照设定步长更新末端位置再映射成机械臂关节目标值不同硬件做适配上层模型完全无感。感知‑推理‑行动全套可配置插件整个闭环流程拆分为感知、推理、行动三大阶段全部能力封装成可开关插件不需要改动主框架。▲表Harness插件沿着感知‑推理‑行动循环组织1感知插件多视图引导告诉VLM全局外视相机、腕部相机分别适合什么场景腕部视图专门用于精细对齐本体状态转文本把夹爪高度、接触状态、步长信息转为文本反馈送入大模型弥补纯视觉的歧义。2推理插件是整套系统发挥能力的关键子任务规划VLM把语言指令拆解为多条可视觉校验的子任务情境规划不确定的决策先搁置等观测到对应视觉信息之后再重新规划动作分块远距离时允许VLM一次性输出一串连续动作开环执行减少大模型调用次数靠近物体自动切回单步推理保证精度自适应步长目标不在腕部视野用大步长进入腕部视野切换精细小步视觉提示当语言难以描述抓取位置生成视觉标记高亮交互区域。3行动插件动作历史保存近期动作序列提示模型避免来回震荡往复运动失败恢复检测空抓取等故障自动复位夹爪、回到对应子任务重试。这套插件是“放大器”零样本模式下使用闭源Gemini‑3.1 Pro等模型微调模式下用LoRA微调2B级别的开源VLM直接预测这套语义动作token仅微调很少比例参数单张24GB显卡就可以完成训练。GUMIGUI式操纵采集界面摆脱专业遥操作硬件因为语义动作空间对人类同样可读研究实现了GUMI图形化操纵接口。▲GUMI界面。GUI操纵界面人类和前沿代理可以通过相同语义控制采集演示人类通过键盘点击按钮就可以操纵真实或者仿真机器人VLM代理也可以调用这套GUI接口。人类操作、AI代理操作产出的是完全同一套格式的样本保存观测图像 语义动作既可以用于微调开源VLM也可以用于训练连续动作策略。此外同一套演示数据只要目标机器人实现对应解释器就可以跨不同机械臂本体复用不需要重新采集。整套采集流程不需要力反馈主手、动捕这类昂贵硬件远程也可以完成数据收集。02 实验实验硬件使用Franka 7自由度单臂AgileX双臂机器人搭配两套多视角相机。测试包含10组物体‑容器配对任务划分训练物体与OOD未见物体评估分为跨任务、跨环境、跨本体三大维度同时做大量消融验证各个插件、动作表示的价值。▲表真实机器人三类泛化设置实验结果。ZS代表零样本Gemini‑3.1 ProFT代表微调Qwen3.5‑2B零样本ZS模式平均任务成功率89%FT微调2B小模型达到86%显著超过π0.5、GR00T、CaP‑X等基线。在背景、光照、视角变化、增加干扰物的跨环境测试ZS模式实现100%成功率FT达到88%仿真到真实迁移FT取得88%。跨本体在Franka、AgileX两套机械臂上ZS平均93%FT 87%。▲图物理与语义适应性能力分析研究进一步做了能力剖析物理适应性改变步长完成插孔、堆叠这类精细任务不需要重新训练模型仅调整解释器步长参数ZS成功率从60%提升到82%旋转角度外推没有训练过的90°姿态依旧可以完成抓取工作空间扩大到边界区域性能衰减幅度远小于VLA基线。双臂协同任务联合预测双臂动作可以完成整理桌面、物体传递。语义适应性杯子下寻找方块这类需要推理的任务开启情境规划插件ZS达到85%成功率支持视频in‑context学习看一遍人类或者机器人演示视频就复现整套操作顺序。▲图Franka真实机器人上零样本agent插件消融实验消融实验可以看到各个插件的实际贡献去掉多视图引导成功率从96%跌到58%移除子任务规划跌到60%关闭失败恢复跌到72%。动作分块、自适应步长在不降低成功率的前提下减少推理步数视觉提示、情境规划在对应困难任务上带来巨大增益。从动作表示消融实验中也可以看出单纯无含义随机token符号很难让VLM学会动作必须附带动作行为的文字约定说明VLM才能真正理解每个语义符号对应的物理效果只靠符号名字本身不够。▲图(a) 动作空间表示方式消融实验(b) 20 次实验中模型推断得到的动作映射结果定性对比可以直观看出差异同样的演示数据训练π0.5容易出现夹爪碰撞、抓取不稳Show‑Harness无论是零样本大模型还是微调小模型能够完成未见物体的抓取放置。▲图与π0.5定性对比。Show‑Harness全部完成三类样例π0.5出现抓取不稳定、夹爪碰撞物体等失败红框标记故障位置局限补充真机实验还是桌面台式操纵物体重量不大没有大量极端的滑、滚等强动态物体这套框架是决策层底层依然依赖机器人本体跟踪控制器如果底层控制器本身失效上层决策再好也无法完成任务。03 语义动作接口控制机器人想要把VLM的通用知识用在机器人不一定非要把大模型改成动作输出头。换一套大模型和机器人之间的接口也可以释放具身能力。它没有去改造VLM网络权重而是设计一套可读的离散语义动作接口让VLM直接参与细粒度物理决策再由解释器做硬件适配。实现两种使用路径前沿闭源VLM直接零样本操控机器人或者少量算力微调轻量开源VLM实现本地部署搭配GUMI降低演示数据采集的硬件门槛。当然这套方案它受限于VLM本身空间推理水平同时推理延迟、缺少触觉反馈、本体拓展不足都是接下来需要补齐的短板。但它提供了一条区别于VLA端到端、传统agent分层调度的新路线给通用大模型落地实体机器人提供新的参考思路。Ref论文标题Show‑Harness: Just a VLM Agent Can Play Robots论文链接https://arxiv.org/pdf/2609.10522项目链接https://showlab.github.io/Show-Harness/
上一篇/下一篇内容由系统自动关联
返回资讯列表 →