论文
RAGNav:面向多目标视觉语言导航的检索增强拓扑推理框架
RAGNav: A Retrieval-Augmented Topological Reasoning Framework for Multi-Goal Visual-Language Navigation
摘要
视觉语言导航(VLN)正从单点寻路迈向更具挑战的多目标 VLN。该任务要求智能体准确识别多个实体,同时协同推理其空间物理约束与顺序执行次序。然而,通用检索增强生成(RAG)范式因缺乏显式空间建模,在处理多对象关联时常出现空间幻觉与规划漂移。为应对这些挑战,我们提出 RAGNav,一个弥合语义推理与物理结构鸿沟的框架。RAGNav 的核心是双基记忆系统,把维护物理连通性的底层拓扑图与做层级环境抽象的高层语义森林结合。基于这一表示,框架引入锚点引导的条件检索与拓扑邻居分数传播机制。这一方法支持快速筛选候选目标、剔除语义噪声,并借拓扑邻域固有的物理关联执行语义校准。该机制显著增强目标间可达性推理能力与顺序规划效率。实验结果表明,RAGNav 在复杂多目标导航任务上取得最先进(SOTA)表现。