论文
通过多线索蒙版细化实现 3D 高斯泼溅中一致的场景理解
Consistent Scene Understanding in 3D Gaussian Splatting via Multi-Cue Mask Refinement
摘要
可靠的实例级场景理解是对象级交互和高保真 3D 表示的基本先决条件。虽然当前的方法通常利用 2D 基础分割模型来获取这些先验,但其以 2D 为中心的设计通常会在不同视图中产生碎片化的掩模和不一致的预测。为了解决这些问题,我们提出了一种新颖的框架,可以生成一致的 2D 实例掩模来指导 3D 高斯分布 (3DGS) 特征字段的优化。我们的框架由三个主要阶段组成。 (1) 多线索提取,从输入图像生成协同语义、几何和结构先验。 (2) 多线索引导掩模合并过程,使用从语义、深度和边缘线索导出的复合合并分数来合并碎片掩模。 (3)跨视图掩模匹配,跨所有视点建立全局一致的身份分配。通过将视点特定的片段转换为连贯的 3D 图元,我们的方法可以实现稳定的 3D 实例分割和有效的下游编辑任务。实验表明,我们的方法在保持高保真光度重建的同时,显着提高了现有基线的跨视图一致性和分割稳定性。