论文
通过工具对齐的视觉-语言-动作模型实现长视野的具体代理
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型是有效的机器人动作执行器,但由于扩展闭环规划和多样化物理操作的双重负担,它们在长期任务上仍然受到限制。因此,我们提出了 VLA-as-Tools,这是一种将这种负担分配给用于时间推理的高级视觉语言模型 (VLM) 代理和一系列用于不同本地物理操作的专用 VLA 工具的策略。 VLM 处理场景分析、全局规划和恢复,而每个 VLA 工具执行有界子任务。为了将长期任务中的代理规划与 VLA 工具执行紧密结合,我们引入了 VLA 工具系列接口,该接口公开了显式的工具选择和执行进度反馈,从而无需连续代理轮询即可实现高效的事件触发代理重新规划。为了获得忠实地遵循代理调用的各种专用VLA工具,我们进一步提出了工具对齐的后训练(TAPT),它构建了用于指令遵循的调用对齐的训练单元,并采用工具族剩余适配器来实现高效的工具专业化。实验表明,VLAs-as-Tools 在 LIBERO-Long 上将 $π_{0.5}$ 的成功率提高了 4.8 点,在 RoboTwin 上提高了 23.1 点,并且通过无偏率测量,进一步将调用保真度提高了 15.0 点。代码将被发布。