论文

PLAF:用于高效 3D 场景理解的逐像素语言对齐特征提取

PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding

应用与实践视觉感知与空间理解

摘要

准确的开放词汇 3D 场景理解需要语义表示在像素级别上既符合语言又具有空间精确性,同时在提升到 3D 空间时保持可扩展性。然而,现有的表示很难共同满足这些要求,并且将像素语义密集传播到 3D 通常会导致大量冗余,从而导致大规模场景中的存储和查询效率低下。为了应对这些挑战,我们提出了 \emph{PLAF},一种逐像素语言对齐特征提取框架,可在 2D 中实现密集且准确的语义对齐,而不会牺牲开放词汇表达能力。在此表示的基础上,我们进一步设计了一种高效的语义存储和查询方案,可显着减少 2D 和 3D 域之间的冗余。实验结果表明,\emph{PLAF} 为准确高效的开放词汇 3D 场景理解提供了强大的语义基础。这些代码可在 https://github.com/RockWenJJ/PLAF 上公开获取。