论文

用于具体问答的分层布局引导视觉语言探索

Hierarchical Floorplan-Guided Vision-Language Exploration for Embodied Question Answering

智能体系统Agent 规划

摘要

具身问答(EQA)要求智能体探索以前未见过的环境,收集相关信息,并回答有关场景的问题。最近的方法利用视觉语言模型(VLM)与语义图或场景图一起指导探索。然而,探索通常仅由局部观察驱动,而有关环境的结构先验在很大程度上仍未被利用。我们提出了 HFLEX-EQA,这是一个分层 EQA 框架,它结合了在线场景图构建、基于 VLM 的规划、语义前沿探索和布局先验。该系统根据 RGB-D 观察逐步构建分层场景图和开放词汇占用图,使 VLM 能够对场景图、任务相关的视觉观察、探索历史和估计的拓扑平面图进行联合推理。此外,我们引入了一种房间发现策略,该策略利用平面图和开放词汇前沿语义来指导探索语义相关但当前未观察到的房间类型。我们在 OpenEQA 和 ExploreEQA 基准上评估 HFLEX-EQA,并演示在真实室内环境中四足机器人上的部署。我们的结果证明了将基于 VLM 的分层规划与 EQA 任务的结构平面图先验相结合的好处。