论文

扩散模型作为通才分割学习者

Diffusion Model as a Generalist Segmentation Learner

应用与实践视觉感知与空间理解

摘要

扩散模型主要针对图像合成进行训练,但它们的去噪轨迹编码了丰富的、空间对齐的视觉先验。在本文中,我们证明这些先验可以用于文本条件语义和开放词汇分割,并且这种方法可以推广到各种下游任务,以形成通用的扩散分割框架。具体来说,我们引入了 DiGSeg(作为通用分割学习器的扩散模型),它将预训练的扩散模型重新调整为统一的分割框架。我们的方法将输入图像和 真值 掩模编码到潜在空间中,并将它们连接起来作为扩散 U-Net 的条件信号。并行的 CLIP 对齐文本路径注入多个尺度的语言特征,使模型能够将文本查询与不断发展的视觉表示对齐。该设计将现成的扩散主干转换为通用界面,可生成根据外观和任意文本提示条件的结构化分割蒙版。大量的实验证明了标准语义分割基准上最先进的性能,以及强大的开放词汇泛化和医疗、遥感和农业场景的跨域传输——无需特定领域的架构定制。这些结果表明,现代扩散主干可以充当通用分割学习器,而不是纯粹的生成器,从而缩小视觉生成和视觉理解之间的差距。