论文
亚语义图像分割
Sub-Semantic Image Segmentation
摘要
图像可以基于视觉线索(即纹理分割)或对象(即语义分割)进行分割。我们提出了一种新的亚语义图像分割类别,模糊了两者之间的界限。在亚语义图像分割中,不使用语言来命名整个对象。相反,它用于将图像划分为可以用语言描述的稳定的外观模式。为此,我们将通用视觉语言模型与 SAM 3 结合起来,SAM 3 是一个快速的分割主干,其本机文本路径可以将丰富的描述融入掩模中。简单耦合会因我们在论文中确定的多种原因而失败,我们通过引入 DETECTURE 来克服它们,它解决了三种具体的故障模式——纹理区域之间的语言泄漏、分割主干内部的迅速竞争以及语言到掩模接口处的语义失真。由于没有亚语义图像分割的数据集,我们引入一个称为TextureADE的数据集。新数据集是使用我们设计的系统从 ADE20K 数据集导出的。我们将 DETECTURE 与多个基线进行比较,发现它在使用不同指标的多个数据集上实现了最强的性能。代码可在 https://github.com/Scientific-Computing-Lab/TextureDetecture 获取。