论文
CAVE-NAV:水下洞穴环境中基于 VLM 的自主 3D 导航
CAVE-NAV: VLM-Based Autonomous 3D Navigation in Underwater Cave Environments
摘要
水下洞穴环境中的自主导航对于搜救行动、科学探索和紧急出口至关重要。传统的导航系统通常依赖于密集的视觉特征来进行定位和绘图。然而,在水下洞穴中,视觉退化可能会破坏基于特征的定位,基于声纳的测绘可能会产生过于保守的障碍物表示,并且通信限制阻碍了实时人类引导。为了解决这些限制,我们提出了一种自主水下洞穴导航框架,该框架利用具有思想链(CoT)推理的视觉语言模型(VLM),从环境线索中推断可导航方向,包括光强度梯度、通道形态和几何复杂性,通过多模态输入捕获,包括RGB图像、深度图和基于声纳的垂直间隙测量,从而支持通过受限洞穴通道的安全3D导航。跨多个洞穴拓扑的高保真模拟表明,所提出的框架完成了所有评估的端到端遍历而没有碰撞,同时保持与洞穴边界的安全间隙。