论文
AnyImageNav:任意视图几何形状,用于精确的最后一米图像目标导航
AnyImageNav: Any-View Geometry for Precise Last-Meter Image-Goal Navigation
摘要
图像目标导航(ImageNav)通过粗略的成功标准进行评估,智能体必须在距离目标 1m 的范围内停止,这对于寻找物体来说足够了,但对于需要精确定位的下游任务(例如抓取)来说是不够的。我们推出了 AnyImageNav,这是一个 无需训练 系统,它将 ImageNav 推向了这种更苛刻的设置。我们的主要见解是,目标图像可以被视为几何查询:物体、走廊或房间角落的任何照片都可以通过密集的像素级对应关系注册到代理的观察结果中,从而能够恢复精确的 6-DoF 相机姿势。我们的方法通过语义到几何级联实现这一点:语义相关信号引导探索并充当接近门,仅当当前视图与目标图像高度相关时调用 3D 多视图基础模型;然后,模型会在循环中自我认证其注册,以获得准确的恢复姿势。我们的方法在 Gibson (93.1%) 和 HM3D (82.6%) 上设置了最先进的导航成功率,并实现了先前方法无法提供的姿态恢复:Gibson 上的位置误差为 0.27m,航向误差为 3.41 度,HM3D 上为 0.21m/1.23 度,比适应的基线提高了 5-10 倍。我们的项目页面: https://yijie21.github.io/ain/