论文

LightSplat:五秒内快速且节省内存的开放词汇 3D 场景理解

LightSplat: Fast and Memory-Efficient Open-Vocabulary 3D Scene Understanding in Five Seconds

应用与实践视觉感知与空间理解

摘要

开放词汇 3D 场景理解使用户能够通过自然语言在复杂的 3D 环境中分割新物体。然而,由于迭代优化和密集的每高斯特征分配,现有方法仍然缓慢、内存密集且过于复杂。为了解决这个问题,我们提出了 LightSplat,这是一种快速且内存高效的 无需训练 框架,它将紧凑的 2 字节语义索引注入到多视图图像的 3D 表示中。通过仅将语义索引分配给显着区域并使用轻量级索引特征映射来管理它们,LightSplat 消除了昂贵的特征优化和存储开销。我们通过链接 3D 中几何和语义相关掩模的单步聚类进一步确保语义一致性和高效推理。我们在 LERF-OVS、ScanNet 和 DL3DV-OVS 上跨复杂的室内外场景评估我们的方法。因此,LightSplat 实现了最先进的性能,加速高达 50-400 倍,内存减少 64 倍,从而实现可扩展的语言驱动的 3D 理解。有关更多详细信息,请访问我们的项目页面 https://vision3d-lab.github.io/lightsplat/。