论文

UOT-Gap:通过不平衡最优传输解决视觉语言模型模态间隙的变分原理

UOT-Gap: A Variational Principle for the Modality Gap in Vision-Language Models via Unbalanced Optimal Transport

模型评测评测方法与指标

摘要

CLIP 等视觉语言模型将图像和文本嵌入到共享空间中,其中特定于模态的分布通常保持分离。现有的解释将这种模态差距与初始化、对比动态和信息不平衡联系起来,而其对检索的分布和成对贡献仍未解决。我们引入了 UOT-Gap,这是一种 无需训练 变分诊断,它利用不平衡熵最优传输 (UOT) 对冻结图像和文本嵌入进行建模。 UOT 最优分离了传输、耦合复杂性和边际质量变化;互补对感知残差将观察到的图像标题对与 UOT 软匹配进行比较。在具有冻结 CLIP、OpenCLIP 和 SigLIP 编码器的 Flickr8K 和 COCO-1K 上,字幕降级会将 Flickr8K Recall@1 从 0.559 降低到 0.003。在六个数据集模型条件下,配对感知残差跟踪检索退化,平均绝对 Spearman 为 0.973,而平均差距为 0.392。五个随机 COCO-1K 子集的关联保持稳定,为 $0.954\pm0.026$,最小值为 0.943。 UOT 重心更新减少了传输目标,同时降低了检索能力,将几何目标下降与任务改进区分开来。这些结果将 UOT-Gap 确立为字幕质量、模态对齐和检索鲁棒性的诊断工具。