论文

具有开放词汇理解的紧凑对象级表示,用于室内视觉重新定位

Compact Object-Level Representations with Open-Vocabulary Understanding for Indoor Visual Relocalization

应用与实践视觉感知与空间理解

摘要

室内视觉重新定位在新兴的空间和实体人工智能应用中发挥着至关重要的作用。然而,先前的研究主要致力于底层视觉方案,难以感知场景语义和构图,这限制了可解释性和适用性。在本文中,我们探讨了如何将场景中丰富的对象信息(包括语义、布局和几何)组织成结构化地图表示,从而专门利用对象单元来驱动相机重定位任务。为此,我们提出了 OpenReLoc,这是一种相机重定位系统,旨在提供场景理解和准确的姿态估计功能。利用最新的基础模型,我们首先引入一种多模态机制来集成开放词汇语义知识,以实现有效的 2D-3D 对象匹配。此外,我们设计了面向对象的参考帧作为位置先验,并与基于距离 IoU (DIOU) 的参考帧选择策略配对,从而能够扩展到可扩展的场景。此外,为了确保稳定和准确的姿态优化,我们还提出了一种由物体形状引导的双路径2D迭代最近像素损失。实验结果表明,OpenReLoc 在各种数据集上实现了卓越的重定位召回率和准确性。我们的源代码将在接受后发布。