论文

CLOSER-VLN:空中视觉语言导航的闭环自验证检索增强推理

CLOSER-VLN: Closed-Loop Self-Verified Retrieval-Augmented Reasoning for Aerial Vision-Language Navigation

智能体系统Agent 架构与控制循环

摘要

视觉语言导航(VLN)最近在大语言和多模式模型方面取得了进展,使智能体能够在看不见的环境中遵循自然语言指令,而无需训练特定于任务的导航策略。然而,大多数现有的依赖于大型模型的 VLN 方法仍然采用开环决策执行方法,其中候选动作是根据指令和观察生成的,但很少在执行前进行验证或纠正。这会导致空中 VLN 出现严重问题,中间动作中的微小错误可能会迅速累积成较大的轨迹偏差并导致目标丢失。为了解决这个问题,我们提出了闭环自验证检索增强推理(CLOSER),这是一种无训练策略的方法,在执行具体动作之前以闭环方式顺序执行动作推理、可靠性验证、有针对性的检索和动作校正。我们在空中 VLN 任务中实例化 CLOSER,并开发了一个 CLOSER-VLN 框架,该框架由三个组件组成:用于根据可用信息生成候选动作的分层推理器、用于评估推理器生成的动作的可靠性的多维动作验证器、以及仅在验证失败时从存储库检索目标样本的验证触发的多模态 检索器。我们在 CityNav 基准上进行了实验评估,其中 CLOSER-VLN 在测试未见的分割上实现了 32.01% SR 和 21.28% SPL,证实了闭环推理的有效性。