论文
Ilov3Splat:高斯泼溅中的实例级开放词汇 3D 场景理解
Ilov3Splat: Instance-Level Open-Vocabulary 3D Scene Understanding in Gaussian Splatting
摘要
我们介绍了 Ilov3Splat,这是一种基于 3D 高斯分布 (3D-GS) 构建的实例级开放词汇 3D 场景理解的新颖框架。大多数先前的工作依赖于基于 2D 渲染的匹配或点级语义关联,这破坏了跨视图一致性,缺乏连贯的实例级推理,并限制了下游 3D 任务的精度。为了解决这些限制,我们的方法通过使用视图一致的特征场增强高斯图来联合优化场景几何和语义表示。具体来说,我们利用多分辨率哈希嵌入来有效地编码与语言一致的 CLIP 特征,从而在 3D 空间中实现密集且连贯的语言基础。我们使用 SAM 掩模上的对比损失进一步训练实例特征字段,支持跨视图的细粒度对象区分。在推理时,CLIP 编码的查询与学习到的特征进行匹配,然后进行两阶段 3D 聚类以检索相关的高斯组。这使得我们的框架能够基于自然语言描述识别 3D 场景中的任意对象,而不需要类别监督或手动注释。标准基准测试的实验表明,Ilov3Splat 在对象选择和实例分割方面均优于先前的开放词汇 3D-GS 方法,为语言驱动的 3D 场景理解提供了灵活且准确的解决方案。项目页面:https://csiro-robotics.github.io/Ilov3Splat。