论文
视觉和语言导航中从区域到达到实例级目标定位
From Region Arrival to Instance-Level Grounding in Vision-and-Language Navigation
摘要
视觉和语言导航 (VLN) 智能体可能满足传统的成功标准,但仍然无法建立可靠的物体级目标定位,因为当前的评估协议主要奖励在 3 米半径内停止,而很大程度上忽略了智能体的最终方向和目标可见性。我们将这一限制形式化为“最后 3 米目标定位间隙”,并引入了三个以实例为中心的指标来量化接近精度、目标可见性和最终视图目标定位。为了缩小这一差距,我们提出了 REALM(最后 3 米导航的区域到实体对齐),这是一种即插即用、与架构无关的细化模块,可将细粒度目标接近与长视野导航解耦。 REALM 使用可见性感知停止策略来减少过早终止并改善最终视点对齐。我们进一步构建了 REVERIE-AIM,它为最终阶段的目标逼近提供了对象实例级目标和 180K 短期训练样本。对四个不同 VLN 主干网的广泛评估表明,REALM 持续提高接近精度和视觉目标定位成功率,展示了其广泛的适用性。