论文
EffiNav:融合深度和视觉语言,实现高效的目标目标导航
EffiNav: Fusing Depth and Vision-Language for Efficient Object Goal Navigation
摘要
在探索未知环境时定位目标物体是自主代理的一项基本能力,其应用范围从搜索救援到现场机器人。此类任务的简化版本是对象目标导航 (ObjNav)。在 ObjNav 中,成功到达目标对象提供了性能的基本衡量标准;然而,导航轨迹的效率同样重要,因为它表明智能体探索的智能程度以及后续任务剩余的时间。在未知的环境中,高效导航的关键在于决定下一步探索哪里。虽然许多先前的工作旨在解决这一核心挑战并在某些环境中取得了有希望的性能,但最近基于训练的模型和非训练框架仍然分别面临泛化和效率问题,在最坏的情况下可能导致对已访问区域的过度探索或冗余的来回运动。我们在两个广泛使用的模拟基准 Habitat Matterport 3D (HM3D) 和开放词汇对象目标导航 (OVON) 上评估 EffiNav,并进一步验证其在现实环境中对物理机器人的有效性。我们对大量模拟事件进行故障分析。通过最小的修改,我们还将 EffiNav 扩展到 GOAT-BENCH 数据集上的内存增强 ObjNav 任务,展示了其超出标准 ObjNav 设置的适应性。在两个标准指标——成功率 (SR) 和按路径长度加权的成功 (SPL) 方面,EffiNav 匹配或优于最近的基线,反映了其效率、稳健性和实际适用性。认识到两个数据集的不同侧重点,性能表明该框架对于高效的 ObjNav 来说更加平衡和通用。