论文

扩展视觉语言模型不足以减轻偏差

Scaling Vision-Language Models Is Not Enough to Mitigate Bias

模型评测鲁棒性、公平性与可信度评测

摘要

像 CLIP 这样的视觉语言模型 (VLM) 现在是多模态系统的基础,但它们对虚假相关性的鲁棒性在规模上仍然知之甚少。我们首次对 194 个公开可用的 VLM 进行大规模实证研究,包括 16 个模型族,涵盖各种模型大小、24 个训练数据集和三个评估基准,即 ImageNet(整体性能)、CelebA(典型的单属性偏差)和 UrbanCars(复杂的多属性偏差)。在这些设置中,随着评估从 ImageNet ($ρ{=}0.68$) 转向单属性 ($ρ{=}0.48$) 并进一步转向多属性 ($ρ{=}0.05$) 偏差基准,模型规模和性能之间的 Spearman 相关性减弱。相比之下,训练数据的属性(大小和质量)在两个偏差基准上显示出与最差组准确性的更一致的关系。值得注意的是,在同等规模下,经过策划的数据集比未经策划的替代方案提高了高达 25%。最后,架构选择的效果(例如,补丁大小、图像分辨率)高度依赖于上下文,随基准的性质而变化,包括偏差的类型及其在图像中的空间分布。