论文
DiCLIP:扩散模型增强了 CLIP 弱监督语义分割的密集知识
DiCLIP: Diffusion Model Enhances CLIP's Dense Knowledge for Weakly Supervised Semantic Segmentation
摘要
具有图像级标签的弱监督语义分割 (WSSS) 通常利用类激活图 (CAM) 来实现像素级预测。最近,对比语言图像 预训练 (CLIP) 被引入在 WSSS 中生成 CAM。然而,以前的 WSSS 方法仅采用 CLIP 的视觉语言配对属性进行密集定位,忽略了其在视觉和文本模式中固有的有限密集知识,这使得 CAM 生成不理想。在这项工作中,我们提出了 DiCLIP,这是一种新颖的 WSSS 框架,它利用生成扩散模型来增强 CLIP 跨两种模式的密集知识。具体来说,视觉相关增强(VCE)和文本语义增强(TSA)模块被提出用于密集预测增强。为了提高视觉特征的空间意识,我们的 VCE 模块利用扩散的可靠空间一致性来缓解 CLIP 注意力的过度平滑问题。它设计了注意力聚类细化(ACR)模块来可靠地从扩散模型中提取不同的相关图。相关图充当 CLIP 自注意力的多样性偏差,递归地将其视觉特征推向更具辨别力的密集分布。为了增强文本嵌入的语义,我们的 TSA 模块认为单一文本模态不足以涵盖视觉类别的可变性。因此,我们利用扩散的生成能力来维护动态键值缓存模型,将 CAM 生成从补丁文本匹配机制转变为新颖的视觉知识检索范例。通过这些增强功能,DiCLIP 不仅优于 PASCAL VOC 和 MS COCO 上最先进的方法,而且还显着降低了训练成本。代码可在 https://github.com/zwyang6/DiCLIP 上公开获取。