论文
Goal2Pixel:将目标定位到像素以进行视觉语言导航
Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation
摘要
视觉语言模型 (VLM) 已成为连续环境中视觉和语言导航 (VLN-CE) 的共同基础。然而,大多数基于 VLM 的方法将导航视为底层动作预测,这是一个不明确的界面,与短视距运动基元相关,并且由于重复的 VLM 查询而效率低下。我们提出了 Goal2Pixel,一种纯粹的基于像素的范例,它将 VLN-CE 重新表述为可导航的像素定位。 Goal2Pixel 使用图像平面作为 VLM 推理和机器人运动之间的统一空间接口,而不是预测动作:该模型为代理预测可见的可导航像素,该像素被反向投影到 3D 路径点以进行前向导航。对于非向前动作,我们将辅助指示区域附加到图像平面,其中左/右/底部区域分别被解释为左转、右转和停止。为了实现长视野导航,我们提出了一种可见性感知关键帧内存,用于紧凑且信息丰富的历史表示。为了使预训练的 VLM 适应可导航的像素定位,我们引入了语义嵌入和坐标感知辅助损失。 Goal2Pixel 实现了具有竞争力的最先进性能,同时比以前的方法需要更少的 VLM 推理调用。在 R2R-CE Val-Unseen 上,每集仅需要 7.75 个 VLM 调用就实现了 54.1% SR 和 52.5% SPL,比 32.9% SR 的直接动作预测所需的 46.62 次少了 6 倍。 RxR-CE.Project 页面也有同样的趋势:https://baobao0926.github.io/Goal2Pixel/。