论文
SAGE-Nav:利用 LLM 规划和对齐融合进行分层场景图引导导航
SAGE-Nav: Leveraging LLM Planning and Alignment Fusion for Hierarchical Scene Graph-Guided Navigation
摘要
对象-目标导航(ObjNav)要求实体代理仅使用以自我为中心的视觉观察来自主定位指定目标。现有的整体方法难以进行长期推理,并且很难推广到新的环境。为了解决这些限制,我们提出了 SAGE-Nav,这是一种新颖的分层框架,它将 大语言模型 (LLM) 的推理功能与动态场景图集成在一起。至关重要的是,它将异步全局语义规划与高频反应控制环路分离。 LLM 充当全局规划器,将抽象指令分解为一系列基于语义的路径点。为了将这些计划转化为密集的多模态指导,我们设计了一个分层场景图编码器(HSGE),它利用关系图卷积来生成保留语义和空间拓扑的结构感知嵌入。此外,我们开发了目标感知对齐融合网络(GAFN),将实时感知与这些结构先验动态融合。 GAFN 使用具有显式归纳偏差的自适应门控机制,确保低级策略具有稳健的视觉拓扑对齐。 i-THOR 和 RoboTHOR 环境中的广泛评估表明,SAGE-Nav 实现了最先进的性能,在导航效率和零样本泛化方面取得了巨大的进步,同时保持了物理机器人部署所需的低控制延迟。