论文

SEDualVLN:用于视觉语言导航的空间增强双系统

SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation

智能体系统Agent 架构与控制循环

摘要

视觉语言导航(VLN)方法目前遵循两个主要范式:在导航轨迹上微调以直接预测动作的端到端视觉语言模型(VLM)策略,以及集成预训练多模态 大语言模型(MLLM)的零样本模块化管道,以将 无需训练 泛化到不可见的环境。然而,端到端方法难以进行长视距导航,并且缺乏动态推理,而零样本方法则受到有限的空间基础的可靠规划的限制,并且还需要大量的推理时间。为了弥补这一差距,我们引入了 SEDualVLN,一种空间增强的双系统 VLN 框架。系统 1 是一个增强了全局和局部空间意识的 VLM 模型,用于动作生成。系统 2 将通用 MLLM 与地图模块集成,其中 MLLM 通过利用实时 3D 地图的自上而下视图以及渲染路径图像流来规划航路点。两个系统都利用不同形式的空间增强来培养智能体在 VLN 任务中的方向感。最终,它们通过快慢协调的方式合作完成导航任务。 SEDualVLN 在 VLN-CE 基准上实现了最先进的性能,进一步的消融研究证明了每个系统和模块的有效性。