论文

视觉语言模型的域重心和置信度加权预先校准

Domain Recentering and Confidence-Weighted Prior Calibration for Vision-Language Models

模型推理推理验证与自校正

摘要

CLIP 等视觉语言模型实现了强大的零样本分类,但在分布偏移下,视觉嵌入会偏离固定文本嵌入。免训练校准避免了即时学习的每个样本优化,但先前的特征校准为每个图像提供了一个硬簇的完整偏差。我们提出了带有置信度校准的域中心定位(DRC),这是一种从一组未标记的目标图像中调整 CLIP 的免训练方法。 DRC 拟合高斯混合一次,并从每个嵌入中减去分量均值的后加权平均值。然后,它通过对数先验校正来消除残差类别偏好,从置信加权预测中估计先验。在比较方法中,DRC 在跨域数据集上实现了最高的平均准确度,比 ViT-B/16 和 ResNet-50 的零样本 CLIP 分别高出 4.13 和 5.07 个点,并且在 ImageNet 分布变化下也保持了相对于 CLIP 的增益。