论文

LCGNav:视觉语言导航中通用拓扑规划的局部候选感知几何增强

LCGNav: Local Candidate-Aware Geometric Enhancement for General Topological Planning in Vision-Language Navigation

摘要

在线拓扑规划已成为连续环境中视觉语言导航(VLN-CE)的有效范例,但现有方法仍然存在两个局限性:冗余的局部深度信息以及随着拓扑图的增长而减弱对当前前沿候选的关注。为了解决这个问题,我们提出了 LCGNav,一种用于拓扑 VLN 的模块化局部几何增强框架。 LCGNav 将候选深度视图显式转换为 3D 点云,并根据代理的可达范围应用物理截断,从而实现更紧凑的局部几何建模。它还引入了具有瞬态退化的保维局部融合策略,使得几何增强仅应用于当前相关的幽灵节点,而不改变原始规划器接口。 R2R-CE 和 RxR-CE 上的实验表明,LCGNav 作为一种有效的跨架构增强模块,能够以较低的额外训练成本持续改进代表性在线拓扑基线的多个关键指标。当与 ETP-R1 集成时,LCGNav 在 R2R-CE 和 RxR-CE 基准测试的 val-unseen split 上实现了在线拓扑方法比较中的最佳性能。代码可在 https://github.com/shannanshouyin/LCGNav 获取。