论文
超越语义:在 CLIP 稀疏自动编码器中解开信息范围
Beyond Semantics: Disentangling Information Scope in Sparse Autoencoders for CLIP
摘要
稀疏自动编码器 (SAE) 已成为解释 CLIP 视觉编码器内部表示的强大工具,但现有的分析主要集中在各个特征的语义上。我们引入信息范围作为可解释性的补充维度,它描述了 SAE 特征聚合视觉证据的范围,从局部的、特定于块的线索到全局的、图像级信号。我们观察到,一些 SAE 特征在空间扰动下反应一致,而另一些特征则随着微小的输入变化而发生不可预测的变化,这表明它们的潜在范围存在根本区别。为了量化这一点,我们提出了上下文依赖评分(CDS),它将位置稳定的局部范围特征与位置变化的全局范围特征分开。我们的实验表明,不同信息范围的特征对 CLIP 的预测和置信度产生系统不同的影响。这些发现将信息范围确立为理解 CLIP 表示的关键新轴,并提供 SAE 衍生特征的更深入的诊断视图。