论文
用于视觉语言导航的实例丰富语义图
Instance-Enriched Semantic Maps for Visual Language Navigation
摘要
视觉语言导航(VLN)旨在使实体代理能够通过遵循自然语言指令来导航复杂的环境。最近的方法构建语义空间地图并利用 大语言模型 (LLM) 进行推理和决策。尽管取得了这些进步,现有系统缺乏实例级对象细节和对不同用户查询的鲁棒性,限制了复杂室内环境中的可靠导航。为了解决这些限制,我们提出了实例丰富语义图,这是一个具有三个关键贡献的统一框架:(1)实例级二维半(2.5D)丰富信息映射,通过开放词汇全景分割从颜色和深度观察构建地图,保留垂直区别并捕获小对象,同时存储丰富的房间级上下文的不同语义属性和自然语言描述。 (2) 通过基于 LLM 的目标选择进行鲁棒查询处理,该目标选择在类型专业的专家之间动态路由查询,并通过分数级融合集成其输出,从而在不同的查询公式中实现一致的目标选择。 (3) 高效存储的语义表示,与三维 (3D) 场景图方法相比,可减少约 96%,同时保留足够的空间信息用于导航。所提出的 2.5D 表示在预测归一化曲线下面积 (AUC) 方面优于 3D 基线 27% 以上。在导航实验中,与跨不同查询类型的基线相比,我们的方法在对象检索方面实现了超过 17% 的改进,在导航成功方面实现了超过 23% 的改进。该项目页面位于 https://rcilab.github.io/iesm_vln。