论文
稀疏性是关键:从潜在结构中解锁新的见解以进行分布外检测
Sparsity as a Key: Unlocking New Insights from Latent Structures for Out-of-Distribution Detection
摘要
稀疏自动编码器 (SAE) 通过将密集表示分解为稀疏语义组件,在解释 大语言模型 (LLM) 方面取得了巨大成功。然而,它们分析 Vision Transformer (ViTs) 的潜力在很大程度上仍未得到充分开发。在这项工作中,我们首次将 SAE 应用于 ViT [CLS] 词元,以进行分布外 (OOD) 检测,解决依赖纠缠特征表示的现有方法的局限性。我们提出了一种新颖的框架,利用 Top-k SAE 将密集的 [CLS] 特征分解为结构化的潜在空间。通过此分析,我们揭示了分布内 (ID) 数据表现出一致的、特定于类别的激活模式,我们将其形式化为类别激活配置文件 (CAP)。我们的研究揭示了一个关键的结构不变量:虽然 ID 样本在 CAP 内保留了稳定的模式,但 OOD 样本系统地破坏了这种结构。利用这一见解,我们引入了基于核心能量分布差异的评分函数,以量化与理想激活分布的偏差。我们的方法在 FPR95 指标上取得了优异的结果,这对于跨多个基准的安全敏感应用程序至关重要,同时还实现了具有竞争力的 AUROC。总的来说,我们的研究结果表明,SAE 揭示的稀疏、解开的特征可以作为视觉模型中稳健的 OOD 检测的强大、可解释的工具。