论文

重新利用 CLIP 以进行像素级本地化

Repurposing CLIP to Localize at Pixel Level

应用与实践视觉感知与空间理解

摘要

像 CLIP 这样的大规模视觉语言模型已经在图像级别展示了令人印象深刻的开放集本地化能力。然而,由于全局特征偏差,使这种能力适应像素级密集预测带来了挑战。在本文中,我们介绍 CLIPix,这是一个简单而有效的框架,它重新利用 CLIP 来执行像素级定位。通过追溯 CLIP 的分类过程,CLIPix 识别特定于对象的注意区域,并将其重新用作像素级定位线索。为了解决全局偏差引入的噪声,我们提出了一种抗噪声校正策略,细化这些线索以实现更精确的分割。此外,我们引入了本地化嵌入策略来集成本地化和丰富的细节信息,从而实现准确、高分辨率的分割。我们的方法保留了 CLIP 的泛化能力,并释放了其分割任意对象的潜力。对 PASCAL 和 COCO 数据集的大量实验表明 CLIPix 实现了最先进的性能,强调了其有效性。