论文
WOW-Seg:无字开放世界分割模型
WOW-Seg: A Word-free Open World Segmentation Model
摘要
开放世界图像分割旨在通过解决现实世界中遇到的无限开放的对象类别集来实现图像内目标的精确分割和语义理解。然而,传统的闭集分割方法很难适应复杂的开放世界场景,而 SAM 等基础分割模型在强大的分割能力和相对较弱的语义理解之间表现出显着的差异。为了弥合这些差异,我们提出了 WOW-Seg,这是一种无词开放世界分割模型,用于从开放集类别中分割和识别对象。具体来说,WOW-Seg 引入了一种新颖的视觉提示模块 Mask2Token,它将图像掩模转换为视觉标记,并确保它们与 VLLM 特征空间对齐。此外,我们引入了级联注意力掩模来解耦不同实例之间的信息。这种方法减轻了实例间的干扰,从而显着提高了模型性能。我们进一步构建了一个开放世界区域识别测试基准:区域识别数据集(RR-7K)。它包含 7,662 个类别,代表了迄今为止最广泛的类别丰富的区域识别数据集。 WOW-Seg 在 LVIS 数据集上取得了优异的成绩,语义相似度达到 89.7,语义 IoU 达到 82.4。该性能超越了之前的 SOTA,同时仅使用了八分之一的参数数量。这些结果凸显了 WOW-Seg 强大的开放世界泛化能力。代码和相关资源可在 https://github.com/AAwcAA/WOW-Seg-Meta 获取。