论文
AdaGeoVLN:视觉语言导航的跨表示深度和导航时间的选择性几何
AdaGeoVLN: Selective Geometry Across Representation Depth and Navigation Time for Vision-Language Navigation
摘要
视觉语言导航需要将语言与视觉观察保持一致,同时随着时间的推移保持空间理解。几何基础模型(GFM)在整个层次结构中公开中间表示,但导航策略应如何使用这些特征并保留历史几何证据仍然悬而未决。我们引入了 \method{},一个流式 VLN 框架,它解决了 \textbf{表示深度} 和 \textbf{导航时间} 方面的这些问题。分层 GFM-VLM 融合将早期、中间和后期的 GFM 表示耦合到连续的策略阶段,而不是重复注入终端特征。导航感知 GFM 内存根据指令相关性、几何置信度和有限每层预算下的转换新颖性保留历史 VGGT 全局注意力 KV 状态。保留状态在与策略融合之前为后续观察提供几何背景。在 R2R-CE 和 RxR-CE 中,\method{} 使用单个 RGB 流实现了强大的性能,无需额外的特定于导航的外部数据。受控消融表明,多深度耦合的性能明显优于匹配融合位置处的重复终端特征注入。有界导航感知保留可保留导航性能,同时相对于较大内存的临时保留显着减少 GFM-KV 内存。这些发现支持联合检查政策所暴露的几何表示和为未来推理保留的历史证据。代码将在接受后在 https:// humanoid-research.github.io/adageovln/ 上发布。