论文
零样本 VLM 中杂散相关性的密度感知转换
Density-Aware Translation of Spurious Correlations in Zero-Shot VLMs
摘要
视觉语言模型 (VLM),例如 CLIP,可以实现强大的零样本分类。然而,他们的预测仍然对虚假相关性敏感,其中上下文线索主导于语义内容。早期的解决方案通常依赖于 微调 或即时工程,这要么破坏了预训练模型的优势,要么容易产生幻觉。在这项工作中,我们提出了密度感知翻译(DAT),它使用从组参考集导出的局部几何密度项来细化图像文本相似度分数。我们的方法的动机是 CLIP 嵌入表现出模态间隙并位于特征空间中的各向异性壳上:常见模式聚集在均值附近,而罕见模式则被向外推。这种几何形状造成不均匀的对齐,其中虚假相关性被放大,而语义上有意义但罕见的线索被边缘化。为了解决这个问题,我们采用相对度量来根据嵌入密度重新调整相似性,抑制扩散区域中过度自信的分数,同时保留密集的、语义一致的匹配。基准数据集的实验结果表明,最差组和平均准确率得到了一致的改进,突出了密度感知转换作为一种简单而有效的校准机制,可使用多模态模型进行可靠的零样本分类。