论文

PDDL-ART:使用视觉语言模型从长视野机器人操作演示中进行自主符号抽象

PDDL-ART: Autonomous Symbolic Abstraction From Demonstration For Long-Horizon Robotic Manipulation Using Vision-Language Models

智能体系统Agent 规划

摘要

PDDL 的符号规划为长视野机器人操作提供了原则框架,但构建准确的 PDDL 域和问题描述仍然是一个重大瓶颈,通常需要大量的领域专业知识。我们提出了一种名为 PDDL-ART 的基于视觉语言模型 (VLM) 的方法,该框架可根据单个专家演示、自然语言任务描述以及可用的高级操作名称库自动生成特定于任务的 PDDL 域和问题描述。 PDDL-ART 不需要任何域模板、操作签名或 微调。为了确保生成的描述不仅在语法上有效,而且在语义上与演示的任务保持一致,PDDL-ART 引入了在语法、语义和执行级别上运行的多阶段校正管道。执行引导纠正的一个关键组成部分是符号谓词基础。 PDDL-ART 不是仅仅依赖于视觉观察,而是利用现代 VLM 的工具使用功能来结合几何和时间推理来评估仅从图像中无法直接辨别的关系谓词。至关重要的是,模型自主确定何时调用这些工具以及如何解释其输出。我们评估了 PDDL-ART 在发动机维护和家庭领域中具有挑战性的操作任务,包括需要记忆、抽象谓词推理以及在视觉上与初始状态无法区分的目标状态的任务。 PDDL-ART 的平均成功率为 93.3%,而基于 VLM 的基线规划器的平均成功率为 78.3%。