论文
LG-VLN:具有 LangGraph 状态编排的零镜头视觉和语言导航框架
LG-VLN: A Zero-Shot Vision-and-Language Navigation Framework with LangGraph State Orchestration
摘要
连续环境视觉和语言导航 (VLN-CE) 需要在看不见的 3D 环境中解释自然语言指令并执行连续的低级操作。现有方法通常依赖于激光雷达、全景相机或额外的传感器;单独的几何映射和语义导航视觉表示可能会导致长轨迹空间语义不一致。我们提出了 LG-VLN,一种具有共享视觉特征和基于 LangGraph 的状态编排的单目零样本框架。在线前馈 3D 重建网络可预测深度、相机姿势和密集点云,以进行代理姿势估计和全局地图融合。几何和导航共享密集的 CleanDIFT 特征:语义一致性拒绝不正确的帧间对应,而目标实例约束定义视觉参考,其相似性与局部 BLIP-2 图像文本相关性相结合,形成语义值图。 LangGraph 将指令解析、几何感知、语义值更新、路径规划、动作执行和故障恢复表示为具有条件转换、持久状态和模块化恢复机制的有向状态图。在 R2R-CE val-unseen split 的固定 550 集子集上,LG-VLN 实现了 21.3% 的成功率和按路径长度加权的 12.1% 的成功率。消融显示共享语义特征改善了导航,通过结合视觉相似性和图像文本相关性进一步增强导航。结果建立了共享视觉表示和显式状态编排,对于仅使用单目 RGB 的零样本 VLN-CE 来说是有效的。代码将公开发布以确保可重复性。