论文
ProCAP:冻结 CLIP 的概率交叉注意力提示学习
ProCAP: Probabilistic Cross-Attentive Prompt Learning for Vision-Language Models
摘要
CLIP 等预先训练的视觉语言模型可以通过提示识别新类别,但当标记数据稀缺或测试分布发生变化时,它们常常会遇到困难。提示学习仅适应一小部分参数,同时保持骨干网冻结,但许多现有的多模态提示学习器将视觉和文本分支耦合得很弱,并且在低样本情况下可能很脆弱。我们提出了 ProCAP,一种概率交叉注意力提示学习框架,可以在不更新任何 CLIP 权重的情况下提高跨模式交互和训练稳定性:它学习视觉和文本提示标记,并通过堆叠双向多头交叉注意力将它们链接起来,以便两个分支在提示深度上相互完善。为了减少有限监督下的过拟合,我们使用高斯均值和方差参数化提示标记,并使用轻量级 KL 和 L2 惩罚对其进行正则化,并且我们进一步添加一个紧凑的对称 InfoNCE 头,将交叉参与的图像特征与共享低维空间中的类级文本表示对齐。在 11 个数据集上的少样本基类到新类泛化、跨数据集传输以及 ImageNet 转换基准上的域泛化中,ProCAP 实现了强大的总体基类到新类性能和有竞争力的传输性能,同时保持 CLIP 主干不变。