论文

DialogueVPR:迈向对话式视觉地点识别

DialogueVPR: Towards Conversational Visual Place Recognition

模型评测基准与评测资源

摘要

受人类如何交流空间信息的启发,语言引导的地理定位因其直观和实用价值而获得了巨大的关注。尽管取得了这一进展,大多数方法仍然依赖于静态的一次性检索范例,它无法处理现实世界自然语言描述中固有的歧义和不完整性。我们提出了推理检索的范式转变,并引入了对话地点识别(DlgPR),它将本地化​​视为一种交互式的、对话驱动的推理过程。为了支持这项新任务,我们推出了 DlgQuest-Cities,这是第一个基于大规模对话的地点识别基准,以及一个统一的推理框架,将跨模式多级 检索器 与智能提问者 DQ-pilot 结合起来。 DQ-pilot 接受课程培训:在精心策划的 DQ-cities-20k 子集上监督 微调,然后通过 GRPO 对更难的 DQ-cities-10k 分割进行强化细化。两个与任务相关的指标指导学习:用于课程抽样的判别难度指数(DDI)和直接衡量问题引起的检索改进的位置检索增益(PRG)奖励。实验表明,这种基于推理的方法明显优于基线。代码和模型可在 https://github.com/Graysonggg/DlgPR 获取。