论文

Guava:通过机器人操纵Harness将 Frontier VLM 提炼成紧凑型代理

Guava: Distilling Frontier VLMs into a Compact Agent through a Robotic Manipulation Harness

智能体系统Agent Harness

摘要

在大规模视觉语言数据上训练的语言模型已经证明了实体代理的强大潜力。通过将高级推理与用于感知、规划和控制的外部模块相结合,通过使用具体工具来利用模型,为端到端视觉语言动作系统提供了一种有前途的替代方案。然而,目前尚不清楚是什么构成了实体操纵的有效工具,以及这种工具可以在多大程度上释放各种推理模型中的实体能力。在这项工作中,我们提出了 Guava,这是一个通过对代理工作流程、操作空间和观察空间的设计空间进行系统探索而开发的用于具体工具使用的框架框架。我们的研究确定了有效的体现主体的三个关键要素:迭代感知-推理-行动循环、语义行动抽象和多模式观察。为了了解这些设计原则是否适用于小型模型,我们开发了一个端到端训练管道,该管道使用完全在模拟中收集的不到 2K 轨迹将具体操作能力提炼为 4B 开源模型。模拟和现实环境中的实验结果显示其性能可与前沿专有模型相媲美,同时对看不见的物体、新颖的指令和长期任务表现出强大的泛化能力。结果表明,精心设计的Harness可以作为可扩展的、与模型无关的接口来进行实体化操作,从而以最少的训练数据在紧凑的开源模型中实现强大的新兴实体化功能。