论文
SALM:用结构感知潜在遮罩增强 CLIP 细粒度感知
Unlocking Fine-Grained Perception in CLIP via Structurally-Aware Latent Masked Modeling
摘要
CLIP 等视觉语言模型 (VLM) 在全局语义对齐方面表现出色,但往往缺乏细粒度的感知能力。这阻碍了密集的预测任务,并限制了 Multimodal 大语言模型 (MLLM) 的视觉潜力。现有研究试图通过结合以视觉为中心的模型的几何先验来增强 CLIP 的视觉表示。然而,这些策略通常难以实现局部空间结构和全局语义的深度对齐,甚至可能扭曲原始图像文本空间。为了解决这些限制,我们提出了 SALM,一种基于结构感知潜在掩模建模的无监督嵌入对齐框架。 SALM 通过结合显式和隐式机制的双路径设计,有效地协同局部和全局对齐,而不需要任何图像文本对。首先,我们引入了一种双矩阵对齐策略,该策略显式校准样本内空间相关性和激活强度,从而有效地注入局部几何先验。基于此,我们进一步设计了一种潜在掩码建模机制来引导CLIP恢复目标模型缺失的语义细节,从而隐式地将细粒度结构聚合到全局语义空间中。此外,在CLIP的浅层特征固有地具有强大的空间观测能力的经验观察的驱动下,我们自然地将SALM扩展到高效的自蒸馏范式,SALM-Self。这释放了 CLIP 内在的细粒度潜力,而无需依赖任何外部模型。大量实验表明,SALM不仅显着提高了密集预测任务的性能,还提高了CLIP的零样本精度,有效增强了MLLM的细粒度理解能力。项目页面位于 https://qzfm.github.io/salm_project_page/.
