论文

Seed2GS:通过单一参考视图目标定位从 3D 高斯场景中提取无相机 无需训练 对象

Seed2GS: Camera-Free, Training-Free Object Extraction from 3D Gaussian Scenes via a Single Reference-View Grounding

应用与实践视觉感知与空间理解

摘要

从预构建的 3D 高斯溅射 (3DGS) 场景中提取目标对象可实现交互式 3D 编辑。现有方法要么每个场景训练数十分钟,牺牲准确性,要么需要预构建资产可能不包括的原始重建相机。我们提出了 Seed2GS,它无需原始重建相机或特定于场景的表示训练即可实现报告的最高 LERF-MASK 精度。其关键见解是将目标身份与 3D 覆盖范围分开。 QD-SAM3 从几个开放词汇候选者中选择一个可靠的参考掩模,一次性修复身份。然后,种子提升和可见性自适应虚拟轨道从新的视角暴露物体,同时跟踪传播种子而无需重复检测。由于场景保持冻结状态,因此这些遮罩仅监督每个高斯的一个临时前景 logits。在 LERF-MASK 上,Seed2GS 的平均交集比并集 (mIoU) 达到 92.1%,测得的仅计算延迟为 9.3 秒,比最强的场景训练基线高出 3.7 个点,比最接近的无相机基线高出 7.6 个点。每个场景有一个固定的测试参考,整个流程保留了 91.1% mIoU;用 真值 掩码替换其预测种子仅将 MIoU 提高 0.72 个点。在 3D-OVS 上,Seed2GS 达到 95.7% mIoU。