论文

ABot-N1:走向通用视觉语言导航基础模型

ABot-N1: Toward a General Visual Language Navigation Foundation Model

摘要

视觉语言导航基础模型旨在将基于空间决策的深度推理与针对不同具体任务的广泛多功能性相结合。当前的方法通常通过将观察结果直接映射到操作的整体策略来实现这种集成,但它们经常遭受坐标漂移和长尾语义处理不当的问题。此外,这些黑盒映射缺乏可解释性,阻碍了通用性、鲁棒性和透明度的同时实现。我们提出了 ABot-N1,这是迈向通用视觉语言导航基础模型的一步,它通过由双视觉语言信号引导的慢快架构将认知与控制解耦来解决这些挑战。更具体地说,慢速视觉语言推理器在产生像素目标的同时执行显式的思想链推理。这组紧凑的图像空间锚点集可作为各种任务的通用接口,包括点目标、对象目标、POI 目标、指令跟踪和人员跟踪。随后,快速行动专家利用文本提示和像素引导以本机控制频率生成连续的航路点。通过基于像素的锚点与显式语言跟踪相结合,桥接高级意图和底层控制,我们的方法确保了跨模拟和现实世界基准的稳健、可概括和可解释的导航。 ABot-N1 创造了新的最先进记录,特别是在城市规模导航方面取得了巨大成果:将 POI 到达率提高 35.0%(达到 77.3%),并在复杂的室内和室外场景中实现 95.4%/92.9% SR。它还在物体到达、人员跟踪和指令跟踪任务中保持卓越的鲁棒性。新的 Point-Goal/POI-Goal 基准以开源方式发布,以推进城市规模导航领域。