论文

Show-Harness:只需 VLM 代理即可扮演机器人

Show-Harness: Just a VLM Agent Can Play Robots

智能体系统Agent Harness

摘要

基金会视觉语言模型(VLM)展示了关于世界的广泛智能,但将这种智能转化为机器人控制仍然具有挑战性。我们展示了 Show-Harness,这是一种具体化的 Harness,它使 VLM 能够通过将意图与行动联系起来的紧凑语义界面来“扮演”机器人。 Show-Harness 公开了 VLM 可以自然推理的离散语义动作单元,而特定于实施例的解释器确定性地将它们融入本地机器人动作,使 VLM 直接负责细粒度的物理决策。通过相同的界面,Show-Harness 展示了以下方面的可行性:(1) 直接解锁闭源前沿 VLM 以实现零样本机器人控制;(2) 采用小型开源 VLM 进行低成本部署,只需几个 GPU 小时的 微调。我们进一步开发了 GUMI(GUI 操作界面),它将相同的语义动作空间扩展到基于 GUI 的演示集合,允许人类和代理在没有专门的远程操作硬件的情况下跨实施例“玩”机器人。大量实验表明,配备 Show-Harness 的 VLM 代理可以在任务、实施例和环境中稳健地泛化,优于代表性代理和 VLA 范例。这些结果表明,正确的接口可以从基础 VLM 中释放大量的具体功能,而不需要额外的模型容量或昂贵的特定于实施例的预训练。