论文

Diffuse2Seg:扩散模型可以在没有监督的情况下分割任何东西

Diffuse2Seg: Diffusion Models Can Segment Anything Without Supervision

模型训练合成数据

摘要

开放世界实体分割旨在跨域和多粒度(从部分到整个对象)预测任意对象的掩码。在这种情况下,SAM 设定了一个强有力的标准:在 SA-1B 上进行训练,包括 11M 图像和超过 1B 个仔细注释的掩模,它实现了卓越的零样本性能。然而,收集此类标签既昂贵又耗时,这限制了该配方的扩展程度。文本到图像的扩散模型提供了解决这个问题的方法。它们的中间特征可以很好地跨感知任务转移,并且由于当模型将噪声样本去噪为以文本提示为条件的图像时,对象结构就会出现,因此该结构已经编码在这些表示中。因此,它们可以用于开放世界的实体分割,而无需再训练或监督。基于这一观察,我们引入了 Diffuse2Seg,它通过以边缘保留的方式通过自注意力表示传播点提示网格,从而重新利用生成扩散模型来自动生成掩模。 Diffuse2Seg 生成多粒度实例掩码,其性能比之前最先进的标签生成器高出 4.3-7.1 p.p.。在 AR_1000 中跨五个域。在这些生成的掩模上训练实例分割模型将无检测器的开放世界分割提高了 7.4 和 7.7 个百分点。在“things”和“stuff+things”数据集上,在“stuff+things”数据集上超过基于检测器的 UnSAM 2.1 p.p.在 AR_1000 中。最后,我们展示了在 Diffuse2Seg 标签上训练的模型为半监督学习提供了强大的初始化,其性能优于具有 5k 标记图像的完全监督模型。