论文

ViTL:通过视觉语言模型进行时态逻辑引导的零样本自然语言导航

ViTL: Temporal Logic-Guided Zero-Shot Natural Language Navigation via Vision-Language Models

智能体系统Agent 规划

摘要

让机器人能够遵循自然语言命令来完成零样本的长期任务仍然具有挑战性。它需要从自然语言命令中提取隐式的时间和逻辑约束并相应地执行多个子任务。最近的零样本对象导航方法使用视觉语言模型(VLM)来指导未知环境中基于前沿的探索,但它们仅限于单目标任务。现实世界的命令,例如“清洁椅子或沙发,然后打开电视”。需要以时间受限的顺序导航到多个目标,这是现有的零射击系统无法处理的。我们提出了 ViTL,一个在两个层面上解决这一差距的框架。在任务级别,我们使用 大语言模型 (LLM) 将自然语言命令编译为线性时序逻辑 (LTL) 公式,然后将其转换为确定性有限自动机~(DFA),协调多通道值映射并在检测到新对象时触发动态重新规划。在导航级别,我们引入了方向分数:我们不是在整个视场中生成与方向无关的值,而是在观察图像上标记前沿方向并从 VLM 中提取每个方向的分数。 Habitat-Matterport 3D (HM3D) 上的实验表明,完整的框架能够在时间约束下零射击长视野完成自然语言导航任务,并且方向得分在基线上提高了单目标导航的准确性和效率。