论文

FineCog-Nav:集成细粒度认知模块,实现零样本多模态无人机导航

FineCog-Nav: Integrating Fine-grained Cognitive Modules for Zero-shot Multimodal UAV Navigation

摘要

无人机视觉语言导航 (VLN) 要求智能体从以自我为中心的角度导航复杂的 3D 环境,同时在长期范围内遵循模糊的多步骤指令。现有的零样本方法仍然有限,因为它们通常依赖于大型基础模型、通用提示和松散协调的模块。在这项工作中,我们提出了 FineCog-Nav,这是一个受人类认知启发的自上而下的框架,它将导航组织成用于语言处理、感知、注意力、记忆、想象力、推理和决策的细粒度模块。每个模块均由中等规模的基础模型驱动,具有特定于角色的提示和结构化输入输出协议,从而实现有效协作并提高可解释性。为了支持细粒度评估,我们构建了 AerialVLN-Fine,这是一个从 AerialVLN 派生的 300 条轨迹的精选基准,具有句子级指令轨迹对齐和包含明确视觉端点和地标参考的细化指令。实验表明,FineCog-Nav 在指令依从性、长期规划和对未见过的环境的泛化方面始终优于零样本基线。这些结果表明细粒度认知模块化对于零射击空中导航的有效性。项目页面:https://smartdianlab.github.io/projects-FineCogNav。