论文

POINav:基准测试并提高现实世界视觉语言导航的最终到达率

POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation

模型评测基准与评测资源

摘要

现实世界的导航从根本上是由兴趣点 (POI) 驱动的,但达到精确的 POI 仍然是一个关键的“最后一米”挑战。 POI 目标导航的现有视觉语言导航 (VLN) 基准通常会因生成的场景而受到粗粒度或显着的模拟与真实差距的影响。为了弥补这一差距,我们推出了 POINav-Bench,这是第一个为现实世界 POI 目标导航闭环评估而设计的基准测试。它包括使用 3D 高斯分布 (3DGS) 根据现实世界捕获重建的 11 个商业区域,总共覆盖 126,398 $m^{2}$,涵盖 163 个不同的 POI。凭借可遍历性感知注释和参考轨迹,POINAv-Bench 能够在真实、POI 丰富的现实环境中对导航代理进行高保真度评估。在此基础上,我们提出了 POINav Brain-Action Framework,其中 Brain 模块执行基于 POI 的推理,以指导 Action 模块预测现实世界执行的连续路径点。我们进一步整理 POINav 数据集,其中包含 70K 个现实世界标牌入口对。实验表明,我们的框架提供了一条完善现实世界 POI 目标导航的可行途径。