论文

探索 VLM-LLM 导航中的瓶颈:3D 场景理解能力如何影响零样本 VLN

Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN

模型评测模型能力评测

摘要

零样本视觉和语言导航(VLN)因其最小的数据收集成本和固有的泛化性而受到广泛关注。这种范例通常由预先训练的视觉语言模型 (VLM) 和 大语言模型 (LLM) 的集成驱动,其中 VLM 构建 3D 场景图,而 LLM 处理高级推理和决策。然而,该系统存在一个关键瓶颈:当前的3D感知模型优先考虑像素级精度,与实体导航所要求的严格计算限制和实时效率直接冲突。为了解决这一差距,本文量化了 3D 场景理解能力对 VLN 性能的实际影响。基于典型的VLM-LLM框架,我们提出了两个核心子系统的统计成功率(SR)上限:1)慢速LLM规划器,它依赖于拓扑映射语义,2)快速反应导航器,它利用空间坐标和边界框来执行LLM决策。使用最先进的 3D 场景理解模型进行的评估验证了我们提出的界限,并揭示了感知饱和现象,表明感知精度的提高超过一定阈值会导致导航成功的回报递减。我们的研究结果表明,VLN 的 3D 场景理解应该摆脱严格的像素级精度,优先考虑与导航相关的核心词汇和准确的边界框比例。