论文
一种几何,不同的结果:视觉语言模型中模态间隙的读出依赖效应
One Geometry, Different Outcomes: Readout-Dependent Effects of the Modality Gap in Vision-Language Models
摘要
对比视觉语言模型通过对齐匹配的图像文本对来学习共享嵌入空间,但它们的表示仍然被模态间隙分开。先前的工作报告了修改此间隙的不同影响:减少它可以改善零样本分类和跨模式对齐,而删除与间隙相关的结构可能会降低图像文本检索的性能。在本文中,我们为这些任务相关效应提供了统一的几何解释。在 CLIP 和 SigLIP 编码器中,我们发现单个主导方向捕获了图像-文本均值分离的平方范数的 94.4-99.9%,表明均值分离分量近似为一阶。然后,相似性得分的分解确定了三个特定于任务的角色。在零样本分类中,查询端固定间隙偏移减法完全等同于加性类偏差。在标准的跨模态检索中,投影间隙方向并对残差进行重新归一化会丢弃候选特定的范数信息,从而导致乘性排名失真;几何导出的指数跟踪网格搜索最优值(Spearman rho = 0.93)并恢复某些设置中的性能,尽管增益传递不均匀。在混合模态检索中,间隙方向按模态对候选进行排序;与随机或无间隙控制不同,它的删除可以提高跨模式排名。删除后的剩余语义结构定义了一级帐户的限制。总之,这些结果解释了为什么间隙修改可以提高、降低或恢复下游设置的性能。通过阐明间隙修改何时以及为何改变模型行为,该解释为在评估的下游任务中基于相似性的视觉语言系统中选择间隙干预提供了原则基础。