论文

超越压缩:量化视觉表示中的光谱可访问性

Beyond Compression: Quantifying Spectral Accessibility in Vision Representations

模型评测模型行为与机制分析

摘要

视觉语言模型通过学习的投影层将视觉特征映射到共享嵌入空间,但目前尚不清楚这些转换如何改变视觉信息的结构。本研究通过空间频率可访问性检查表示的变化,通过模型表示的带限傅里叶能量的线性可恢复性来测量。为了隔离降维以外的影响,我们引入了残余光谱损失(RSL),它评估相对于维度匹配的随机投影基线的变化。为了减少优化带来的混杂影响,分析使用了所有参数均已冻结的预训练模型。实验结果表明,在 ImageNet 和 MS-COCO 数据集上,CLIP 和 DINOv2 的可访问性随频率变化而变化。光谱可达性遵循跨深度的非单调轨迹,在中间层达到峰值,然后向输出表示下降。最终的转换因架构而异:CLIP 的学习投影是光谱中性的,变化可以通过压缩来解释,而 DINOv2 的 [CLS] 池化会导致整个光谱的结构化损失。这些发现将中间层和池化机制确定为现代视觉编码器中光谱变换的主要驱动因素。