论文
您的 CLIP 有 164 个维度的噪声:探索对比预训练视觉语言 Transformer 的嵌入协方差本征谱
Your CLIP has 164 dimensions of noise: Exploring the embeddings covariance eigenspectrum of contrastively pretrained vision-language transformers
摘要
对比预训练的视觉语言模型 (VLM) 可以作为强大的特征提取器。然而,它们共享的潜在空间很容易出现结构异常,并充当非语义、多模态噪声的存储库。为了解决这一现象,我们采用协方差矩阵的谱分解将 VLM 潜在空间分解为多模态语义信号分量和共享噪声子空间。我们观察到这种噪声几何在不同的数据子集中表现出很强的子组不变性。至关重要的是,修剪这些共享噪声维度基本上是无害的,可以保留或积极提高下游任务性能。通过从人为噪声中分离出真实的语义信号,这项工作为现代 VLM 的表征结构提供了新的机制见解,表明其潜在几何结构的很大一部分是由共享的架构级噪声控制的,而不是单独与任务相关的语义控制的。