论文

看不见的捷径:为什么视觉编码器了解您的相机

Invisible Shortcuts: Why Vision Encoders Know Your Camera

模型评测模型行为与机制分析

摘要

深度视觉模型利用捷径,依赖于与监督信号相关的线索。之前的工作主要集中在可见偏差上,例如对象-背景或纹理相关性。我们确定了捷径学习的不同来源:嵌入在像素级的不可见元数据痕迹,用于图像处理和照片采集等元数据。我们假设大规模语义监督,无论是通过分类标签(ImageNet)还是十亿级图像描述(LAION),都会在预训练期间自然地诱发元数据语义相关性,从而导致模型将底层信号转换为预测特征。通过引入受控的元数据语义相关性,我们表明,更强的相关性会系统地对元数据跟踪产生更高的敏感性,并在元数据分布变化下产生更大的性能下降。我们进一步探索在预训练期间和之后应用的缓解策略,不仅降低对目标元数据的敏感性,而且降低对看不见的元数据的敏感性,而不会牺牲下游任务的性能。元数据敏感性也有积极的一面:它部分解释了某些编码器强大的生成图像检测能力,而其缓解可以提高分布外泛化能力。代码:https://github.com/ryan-caesar-ramos/visual-encoder-traces