论文

FAST3DIS:用于 3D 实例分割的前馈锚定场景 Transformer

FAST3DIS: Feed-forward Anchored Scene Transformer for 3D Instance Segmentation

应用与实践视觉感知与空间理解

摘要

虽然最近的前馈 3D 重建模型为场景理解提供了强大的几何基础,但将它们扩展到 3D 实例分割通常依赖于脱节的“提升和聚类”范例。通过不可微分聚类对密集的像素级嵌入进行分组,与视图数量的缩放比例很差,并且使表示学习与最终分割目标脱节。在本文中,我们提出了一种用于 3D 实例分割 (FAST3DIS) 的前馈锚定场景 Transformer,这是一种有效绕过事后聚类的端到端方法。我们引入了一种基于 3D 锚定、基于查询的 Transformer 架构,该架构建立在基础深度主干之上,可有效地适应学习特定于实例的语义,同时保留其零样本几何先验。我们制定了一个学习的 3D 锚点生成器,与锚点采样交叉注意机制相结合,用于视图一致的 3D 实例分割。通过将 3D 对象查询直接投影到多视图特征图中,我们的方法可以有效地对上下文进行采样。此外,我们引入了双层正则化策略,将多视图对比学习与动态调度的空间重叠惩罚相结合,以明确防止查询冲突并确保精确的实例边界。对复杂室内 3D 数据集的实验表明,与最先进的基于聚类的方法相比,我们的方法显着提高了内存可扩展性和推理速度,实现了有竞争力的分割精度。