论文

STEGNav:多模态终身对象导航的时空事件图推理

STEGNav: Spatio-Temporal Event Graph Reasoning for Multimodal Lifelong Object Navigation

上下文与知识记忆Agent记忆

摘要

多模态终身导航需要代理自主探索看不见的环境,同时顺序完成由对象类别、语言描述或参考图像指定的导航任务。现有方法主要通过构建以状态为中心的语义场景图来完成这些任务。通过将场景图视为语义观察的持久存储库,这些方法努力区分相似的实例,共同表示语义目标和探索前沿,并有效地利用导航记忆和轨迹经验。为了解决这些限制,我们提出了时空事件图导航(STEGNav),这是一个 无需训练 框架,它将传统的场景图扩展到沿着互补的空间和时间轴的时空事件图。空间轴执行查询条件实例基础,并联合表示语义目标和占用感知探索前沿,以可达性、路径成本和探索效用为特征。时间轴采用轨迹感知双窗口存储器来保留最近的决策轨迹事件和经过验证的跨子任务导航结果。基于 VLM 的导航代理对生成的时空事件图进行推理,并选择目标实例或探索前沿作为其下一个导航目标。 STEGNav 在 GOAT-Bench 上实现了 66.3% SR 和 39.7 SPL,在 HM3Dv1 和 HM3Dv2 上分别实现了 64.0% 和 69.4% 的 SR 分数。消融研究和误差分析验证了两个轴的互补效应,证明事件驱动的时空表示提高了导航可靠性和跨子任务经验重用。