论文

将视觉-语言-动作模型发展为具有即时工具使用功能的代理

Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use

智能体系统Agent 工具调用

摘要

本文将端到端视觉语言动作(VLA)模型与代理工具使用相结合,提出了具有工具使用的代理机器人(ART)。 ART 是一个工具注入框架,可调整任何 VLA 模型以利用现成的工具模块来实现底层视觉、高层可供性和具身能力增强。与具有完整连续动作解决方案空间的普通 VLA 模型相比,ART 通过工具使用降低了动作解决方案空间的复杂性,这不仅提高了不同任务之间的通用性,还减少了数据依赖性。为了展示该框架的优点(高通用性和低数据依赖性),我们首先构建了一个包含 30K 工具使用轨迹和动作演示的数据集,该数据集比基线方法使用的数据集要小得多。然后,我们设计了一种在具有挑战性的环境中进行长轨迹工具使用推理的训练方案。实验表明,在模拟和现实世界任务(例如在黑暗中以新视角进行拾取和放置)中,ART 的成功率比主流基线高出 20%。实证结果凸显了基于代理的方法的优势:模块化工具的利用可以实现更高效的训练、轻量级部署以及新工具的可扩展集成。这种设计增强了鲁棒性、适应性和可扩展性,为 VLA 系统在复杂的现实场景中的实际部署铺平了道路。