论文

SYMBOLIZER:使用 VLM 进行符号无模型任务规划

SYMBOLIZER: Symbolic Model-free Task Planning with VLMs

智能体系统Agent 规划

摘要

传统的任务和运动规划(TAMP)系统依赖于运动规划的物理模型和任务规划的离散符号模型。尽管物理模型通常可用,但符号模型(由符号状态解释和动作模型组成)必须精心制作或从标记数据中学习。此过程既占用资源,又将解决方案限制在特定领域,从而限制了可扩展性和适应性。另一方面,视觉语言模型(VLM)显示出理想的零样本视觉理解(由于其对异构数据的广泛训练),但仍然实现有限的规划能力。因此,将 VLM 与 TAMP 问题中的长期推理的经典规划相结合具有很大的潜力。最近在这个方向上的工作仍然缺乏通用性,并且依赖于手工制作的、针对特定任务的解决方案,例如提前描述所有可能的对象,或使用符号动作模型。我们提出了一个可以很好地推广到未见过的问题实例的框架。该方法仅需要描述对象之间关系的提升谓词,并使用 VLM 将它们从图像中获取符号状态。规划是通过使用目标计数和基于宽度的启发式的与领域无关的启发式搜索来执行的,无需操作模型。基于 VLM 的状态空间上的符号搜索优于直接基于 VLM 的规划,并且与使用 VLM 派生启发式方法的方法性能相当。这表明与域无关的搜索可以有效地解决具有大组合状态空间的跨域问题。我们对我们的方法进行了广泛的评估,并在 ProDG 和 ViPlan 基准测试中取得了最先进的结果。