论文
SAM-V:用于多视图实例分割的几何感知分割任何内容
SAM-V: Geometry-Aware Segment Anything for Multi-View Instance Segmentation
摘要
一致的多视图对象分割对于 3D 感知和机器人技术至关重要,但在严重的视点和遮挡变化下仍然具有挑战性。现有方法通常在点云上执行 3D 实例分割或依赖离线 2D 掩模匹配管道。然而,3D 实例分割受到稀缺 3D 注释的限制,而离线 2D 匹配则面临帧间对象身份模糊的问题。为了联合利用强大的 2D 和 3D 先验,我们提出了 SAM-V(用于多视图实例分割的几何感知分段任意)。 SAM-V 不是通过事后匹配来组合两个先验,而是直接将前馈几何模型 (VGGT) 的特征集成到 2D 分割基础模型 (SAM) 中,并进行端到端训练以进行跨视图实例预测。 SAM-V 引入了一种提示融合机制,该机制通过特定于视图的相机标记和本地 VGGT 特征来丰富稀疏 SAM 提示标记,使提示表示既具有视图感知性又具有空间对齐性,同时还具有处理密集 2D 和 3D 特征的掩模解码器。通过直接在多视图几何上调节掩模解码,SAM-V 在单次前向传递中生成提示对象的一致多视图分割,无需离线掩模匹配或显式 3D 重建。在 IGGT 3D 跟踪基准测试中,跨帧的一致实例标识直接决定性能,与最先进的多视图实例分割基准相比,SAM-V 在 ScanNet++ 分割上将整体 IoU 提高了 5 个点,将帧级召回率提高了 12 个点,并且在零样本 ScanNet 分割中的所有指标上均领先。我们的代码和预训练模型可从此 https URL 获取。