论文
See-and-Reach:无人机视场内的精确视觉语言导航
See-and-Reach: Precise Vision-Language Navigation for UAVs within the Field of View
摘要
无人机视觉语言导航(UAV-VLN)通常被表述为整体搜索和到达问题,其中远程目标发现和最终目标方法被联合优化和评估。这种表述使得评估空中实体的关键能力变得困难,即无人机是否能够准确地将可见目标着陆并在目标进入其视野后将视觉语言证据转化为精确的 3D 运动。为了解决这一限制,我们引入了 UAV-VLN-FOV,这是一种目标可见导航任务,可隔离查看和到达阶段,并对终端到达能力进行更多诊断评估。我们进一步提出了 3DG-VLN,一种由动态 3D 方向线索引导的视觉语言路点预测框架,以增强细粒度的视觉定位和空间方向对齐,以实现精确的目标到达。具体来说,3DG-VLN 自适应处理高分辨率前视和下视观测结果,以保留目标定位的细粒度视觉和几何细节。它还在闭环导航期间在线更新目标相对方向,使代理能够保持与目标的空间对齐并减少累积的方向漂移。为了支持这项任务,我们构建了一个专用的高分辨率基准,其中包含 2,717 条轨迹,具有面向目标的高级指令、高分辨率前视图和下视图自我中心观察以及连续 3D 航路点注释。实验表明,3DG-VLN 的性能优于竞争性 UAV-VLN 基线,成功率提高了 13.82%。现实世界的试验进一步证明了 3DG-VLN 在实际可视及到达导航方面的潜力。源代码和基准测试可在 https://github.com/xuefanfu/3DG-VLN 获取。