论文
MARS-CLIP:多分辨率和注意力细化零样本图像分割
MARS-CLIP: Multi-Resolution and Attention Refined Zero-Shot Image Segmentation
摘要
对比语言图像 预训练 (CLIP) 在零样本传输方面表现出了令人印象深刻的能力,但由于空间分辨率低和结构信息丢失,常常难以应对密集的预测任务。为了解决这些限制,我们提出了 MARS-CLIP(CLIP 的多分辨率和注意力精细分割),这是一种零样本语义分割的新颖框架。我们的方法引入了两个关键策略:(i)多分辨率特征提取模块,将局部细粒度特征与全局上下文融合,以克服输入分辨率限制;(ii)注意力细化机制,将中间层的空间和颜色偏差注入最终的自注意力块,以准确恢复对象边界。对六个公共数据集进行的一组实验表明,MARS-CLIP 的性能显着优于最先进的方法。