论文
AwareVLN:视觉语言导航的自我意识推理
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
摘要
视觉和语言导航(VLN)要求智能体在视觉环境中将语言指令传达给它自己的运动。虽然最先进的方法利用视觉语言模型 (VLM) 的推理能力进行端到端动作预测,但它们通常缺乏对代理、指令和场景之间关系的明确且可解释的理解。相反,为启发式规划显式构建场景地图直观上很有吸引力,但依赖于额外的 3D 传感器并阻碍大规模视觉语言 预训练。为了弥补这一差距,我们提出了 AwareVLN,这是一种新颖的框架,为导航模型配备了自我感知推理机制,使其能够以完全端到端和数据驱动的方式了解代理的状态和任务进度。我们的方法有两个关键创新:(1) 结构推理模块,可培养空间和面向任务的自我意识;(2) 具有进度划分的自动数据引擎,可进行有效训练。在栖息地模拟器中对各种数据集进行的广泛实验表明,我们的 AwareVLN 显着优于以前最先进的视觉语言导航方法。项目页面:https://gwxuan.github.io/AwareVLN/。