论文

AnchorVLN:用于开放词汇导航的几何锚定视觉语言基础推理

AnchorVLN: Geometry-Anchored Vision-Language Grounding Reasoning for Open-Vocabulary Navigation

智能体系统Agent 工具调用

摘要

看不见的室内环境中的视觉语言导航 (VLN) 在现实世界的机器人技术中非常有用,其中代理必须遵循自然语言指令、定位对象并回答空间问题,而无需预先构建的地图或固定的对象词汇表。多模态视觉语言模型 (VLM) 提供强大的开放词汇基础和零样本推理,但很难直接从图像中发出可靠的度量量,例如距离、方位和比较空间关系。现有的方法通过将几何图形折叠到手工设计的管道中或要求模型输出路径点来解决这个问题,从而需要针对不同的机器人、任务或词汇更改控制堆栈。我们介绍 AnchorVLN,一个基于简单规则构建的开放词汇 VLN 系统:VLM 提出语义;几何形状决定度量。它被实现为 EMBODIED-NAV-MCP,一个由 VLM 代理通过一组紧凑的可调用工具驱动的模型上下文协议 (MCP) 服务器。由于没有工具接受以米为单位的距离或以弧度为单位的方位,因此该模式强制执行语义几何边界,而无需修改下游自治堆栈。我们对 2026 年 CMU 视觉语言导航挑战赛的两项任务进行了基准测试:15 个场景中的 30 个指令跟踪问题和一个包含 45 个问题的冻结对象参考集。整个系统的指令遵循率达到 64.4%,在没有控制器建模的情况下下降了 13.3 个百分点 (t = 2.77)。在对象参考方面,几何锚定清除了 45 个问题中的 10 个问题的挑战重叠阈值,而直接坐标估计的 45 个问题中清除了 0 个问题,将中值中心误差从 3.37 m 减少到 2.48 m。