论文

VLN on the Fly:空中机器人机载视觉语言导航堆栈

VLN on the Fly: An Onboard Vision-Language Navigation Stack for Aerial Robots

摘要

在空中机器人上完全运行视觉语言导航很困难,因为视觉定位、规划和控制必须共享有限的计算,并且在飞行中很难隔离单级错误。端到端空中策略将这些阶段融合到一个网络中,放弃了模块化堆栈保持可用的可观察性和安全检查。我们提出了 VLN on the Fly,这是一种机载堆栈,可将视觉定位、规划和控制作为单独的、可检查的阶段进行。量化的 VLM 将指令定位到粗图像单元,深度将其提升到 3D 目标,快速 B 样条规划器返回可行的轨迹,预训练的强化学习策略将其跟踪到四旋翼飞行器的电机命令。在受控室内空间内对三个日常参照物进行 15 次机载飞行中,该堆栈在 15 次试验中的 13 次中达到了目标,平均目标误差为 5.72 厘米,平均 GPU 利用率为 39.3%。在 6 个额外的杂乱环境试验中,堆栈在机载感知门控下跟踪无碰撞轨迹。