论文

SAE 的独立性先验如何割裂视觉概念

The Independence Prior of SAEs Fragments Visual Concepts

模型评测模型行为与机制分析

摘要

稀疏自动编码器 (SAE) 将模型激活分解为可解释字典原子的稀疏组合。尽管 SAE 建立在线性表示假说 (LRH) 的基础上,但它们的客观性带有一个额外的先验:跨补丁的概念被视为独立的,这一假设显然被自然图像及其引发的激活所违反。因此,我们通过马尔可夫场线性表示假设(MFLRH)将 LRH 专门用于视觉,该假设将缺失的空间依赖性添加到 LRH 假设中。因此,我们建议 Spatial-SAE 作为 MFLRH 下的摊销 MAP 估计器。 Spatial-SAE 在概念恢复和可解释性方面始终优于标准 SAE。在四个变体中,它在合成概念恢复方面实现了 96% 的平均胜率,并提高了 DINOv2 激活的可解释性,而重建成本集中在高空间频率。