重新思考 CLIP 训练后的对比损失:带有 Frozen Text Encoder 的补充框架
Rethinking Contrastive Loss in CLIP Post-training: A Complementary Framework with Frozen Text Encoder
摘要
CLIP 是下游 VLM(例如 LLaVA)的基础视觉语言模型和事实上的视觉编码器。后训练提供了一种改进 CLIP 的轻量级途径,但最近的研究认为,由于小批量下的灾难性遗忘,标准对比损失不适合后训练,这促使设计放弃对比目标而转而采用蒸馏。我们重新审视这个前提,发现对于 InfoNCE 目标,报告的遗忘主要不是由负数不足驱动的,而是由对比温度 $τ$ 的不适当大小驱动的:当 $τ$ 设置得足够小时,对比后训练会改善而不是降低预训练的 CLIP,我们通过 InfoNCE 梯度的温度依赖性来解释这一点。基于这一发现,我们提出了 \textbf{ComCLIP},这是一种轻量级的单周期后训练配方,可以冻结 CLIP 的文本编码器——因此精炼的视觉编码器是架构和推理成本不变的直接替代品——并使用经过适当调和的视觉编码器来训练视觉编码器 对比损失、针对原始 CLIP 的 MSE 锚定损失以及 DINOv2 的相关蒸馏损失。在多个种子上,ComCLIP 在零样本分类上与自蒸馏基线 CLIP-Refine 相匹配,同时显着提高了视觉特征的可转移性,通过线性探测测量(ViT-B/16 上为 48.99 美元对比\ 42.28 美元),并且在 ViT-L/14 上它还比 CLIP-Refine 提高了 MMVP(24.20 美元对比\ 19.01 美元); CLIP-Refine 在图像文本检索方面仍然更强。 ComCLIP 用作 LLaVA-1.5-7B 的嵌入式视觉编码器,无需重新调整投影仪或 LLM,在 8 美元的 VLM 基准测试中不会产生净变化,即改进不会破坏下游兼容性。代码和型号可在 https://github.com/showstarpro/ComCLIP.git. 获取