论文

分割和选择:3D 场景中的视觉语言分割

Segment and Select: Vision-Language Segmentation in 3D Scenarios

应用与实践视觉感知与空间理解

摘要

3D视觉语言分割旨在根据语言指令和视觉观察来分割3D场景中的目标对象。现有技术严重依赖于粗略的超点表示来降低计算复杂度,这会导致分割质量差和对象边界混乱。在本文中,我们提出了用于 3D 视觉语言分割的 SEGment-And-select (SEGA3D) 范式,它直接对细粒度视觉信息进行操作,并且不受超点依赖性的影响。具体来说,我们首先利用掩模候选生成器来提供细粒度的分类掩模候选,从而大大提高了候选掩模相对于超点对应物的质量。然后,利用大语言模型(LLM)根据语言描述和视觉特征生成语义和空间信息。 LLM 输出和视觉特征被馈送到语义空间选择器 (SSS) 以生成排名靠前的掩模候选。最终,环回验证模块 (LVM) 被设计为从选定的候选掩码中生成分段掩码。我们的 SEGA3D 在 ScanRefer、ScanNet 和 Matterport3D 基准测试中获得了具有竞争力的性能。值得注意的是,我们的 SEGA3D 在 ScanNet 和 Matterport3D 上分别超过了表现最佳的对手 8.3 mIoU 和 5.3 mIoU。代码将在发布后提供。