论文
RiverVLN:按任务阶段对齐的无人水面艇时序视觉语言导航
RiverVLN: Phase-Grounded Temporal Vision--Language Navigation for Unmanned Surface Vehicles
摘要
视觉语言导航(VLN)主要是为室内和陆地机器人开发的,其中语言通常可以被视为静态目标,而运动则通过离散或近乎瞬时的动作来近似。这些假设对于无人水面艇 (USV) 来说不成立:河流航行需要在惯性和有限的机动性下连续运动,而长程指令必须通过稀疏且视觉模糊的海上地标执行。我们介绍了 RiverVLN,据我们所知,这是为连续河流运动下的长程 USV VLN 设计的第一个基准,以及 PGT-NAV,一种用于 USV 的按任务阶段对齐的时序导航框架。 PGT-NAV 不是直接将整个指令映射到运动,而是将其转换为视觉可验证语义阶段的有序序列,并通过视觉和运动证据在线维护活动阶段。这种显式语义进展状态与视觉运动历史和特定阶段的视觉对应关系相融合,以预测六个局部 SE(2) 姿势增量。生成的轨迹在预测-执行-重新观察循环中执行,其中船舶向 W3 执行,更新任务阶段及视觉对应关系,并通过基于地图的安全层重新规划。实验表明,PGT-NAV 相对于 GNM 式和 ViNT 式基线大幅减少了递归位置和航向漂移,并在 Unity-ROS 闭环导航中实现了 0.79 的平均成功率。未见过的桥孔通行试验和现实世界的 USV 实验进一步证明了按任务阶段对齐的表示从受控评估转移到物理 USV 部署。