论文
VoLN:纯视觉长程导航的范式、基准与方法
VoLN: Vision-Only Long-Horizon Navigation---Paradigm, Benchmark, and Method
摘要
视觉语言导航让具身 Agent 按自然语言指令行动,但路线指令常提供方向、距离与布局先验,这些信息在开放、无 GPS 环境中未必可由机载传感直接得到。因此这类基准同时衡量视觉导航和利用任务描述所提供路线结构的能力。论文提出互补的纯视觉长程导航 VoLN,将路线信息从外部指令与全局引导转为当地可见场景线索。目标视图指定目的地,Agent 必须在线检测、解释和选择路线线索。VoLN-UAV 包含 7210 次长程目标飞行任务,结合连续三维运动、大幅视角变化与上下文相关信标选择。初始参考基线 VoLN-MLLM 将自监督视觉特征对齐到结构化语义空间,以观测历史、目标视图、检索视觉语义词元及本体感觉预测短程航点。在五种环境的 Test-Unseen 中,易、中、难任务成功率分别为 7.4%、4.5%、1.8%。结果揭示长程证据整合、跨视角目标匹配和闭环稳定性仍具挑战。项目页面:https://admire-ljb.github.io/VoLN-UAV/