论文
QueryGaussian:可扩展和 无需训练 开放词汇 3D 实例检索
QueryGaussian: Scalable and Training-Free Open-Vocabulary 3D Instance Retrieval
摘要
通过自然语言提示从大规模场景中高效检索特定 3D 实例仍然是多媒体分析中的一项艰巨挑战。现有方法主要遵循“场景级嵌入”范式,这需要将高维语义特征提取到每个 3D 图元中。该策略存在一个基本的架构瓶颈:内存和计算成本随着场景复杂性线性扩展,不可避免地会在城市规模的环境中触发内存不足(OOM)故障。为了解决这个障碍,我们提出了 QueryGaussian,这是一个 无需训练 框架,用于快速且可扩展的开放词汇 3D 实例检索。与整体语义 蒸馏 不同,QueryGaussian 采用实例级查询机制,将语义理解与几何表示解耦。具体来说,我们利用预先训练的 2D 视觉模型来解释用户提示,并通过并发最大权重关联策略将分割掩模提升为 3D,从而确保语义视觉一致性。为了减轻投影模糊性,我们引入了具有多阶段自适应密度聚类的时间融合模块。实验结果表明,QueryGaussian 不仅可以达到最先进方法的准确性,而且还实现了决定性的效率飞跃,将 GPU 内存使用量减少了 70% 以上,并将推理速度提高了 180 倍。至关重要的是,QueryGaussian 能够使用消费级硬件在包含数千万个高斯的城市规模场景中进行快速实例检索。