论文
ESV:用于开放词汇 3D 场景理解的语言嵌入式稀疏体素融合
LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding
摘要
开放词汇 3D 场景理解的最新进展在很大程度上依赖于 3D 高斯分布 (3DGS) 将视觉语言特征注册到 3D 空间中。然而,我们发现这些方法存在两个关键局限性:由非结构化、重叠高斯分布引起的空间模糊性,需要概率特征配准;以及由对象级掩模上的特征池引起的多级语义模糊性,这会淡化细粒度的细节。为了应对这些挑战,我们提出了一种新颖的框架,该框架利用稀疏体素光栅化(SVRaster)作为结构化、不相交的几何表示。通过用单眼深度和法线先验对 SVRaster 进行正则化,我们建立了稳定的几何基础。这可实现确定性、置信感知的特征注册过程,并抑制 3DGS 中常见的语义渗漏伪影。此外,我们通过利用 AM-RADIO 基础模型新兴的密集对齐特性来解决多级歧义,避免了分层训练方法的计算开销。我们的方法在开放词汇点云理解方面实现了最先进的性能,并在 3D 和 2D 对象检索基准上取得了极具竞争力的结果。