论文
TANDEM:任务和运动规划以及按需演示,以实现高效的视觉-语言-动作模型微调
TANDEM: Task and Motion Planning with As-Needed Demonstrations for Efficient Vision-Language-Action Model Fine-tuning
摘要
人类远程操作员花费大量时间来演示机器人已经可以自主执行的行为,从而限制了机器人基础模型数据收集的可扩展性。任务和运动规划 (TAMP) 可以自动化其中许多行为,但固定的规划域可能无法支持长范围操作任务的每个阶段。我们推出了 TANDEM(Tamp with As-Needed Demonstrations for Efficient Model Fine-tuning),这是一个将 TAMP 与选择性人工远程操作相结合的系统,用于收集超出规划者能力的任务的演示。我们的关键想法是将人工协助表示为一种按需规划能力。给定语言指令和视觉观察,TANDEM 使用预训练的视觉语言模型来扩展缺少谓词和人类执行的魔法运算符的规划域。这使得规划者可以将自主执行阶段和人工执行阶段交错在一起,而无需特定于任务的干预点。在每个人类阶段之后,TANDEM 都会重新感知场景并检查预期效果是否成立,然后再恢复自主规划。为了支持微调视觉语言动作 (VLA) 模型,TANDEM 还使用示例预训练轨迹将规划器生成的运动与目标模型的预训练分布对齐。我们在超出 TAMP 域能力的五种长期操作任务上评估 TANDEM。在具有代表性的长期任务中,TANDEM 在相同的人工干预时间内收集的演示数量是全任务远程操作的 2.9 倍。在每个任务 20 个 TANDEM 演示上微调预训练的 \pi_{0.5}-DROID 模型,可将五项任务的平均任务成功率从 0% 提高到 60%。