论文
ClasSAE:通过可微特征与类别关联训练类别对齐稀疏自编码器
ClasSAE: Class-Aligned Sparse Autoencoders via Differentiable Feature-Class Affinity
摘要
稀疏自动编码器 (SAE) 最初是一种无监督工具,用于将神经表示分解为稀疏的、可解释的特征,并且越来越多地不仅用于被动分析,还越来越多地用于主动干预,例如 遗忘、偏差缓解和概念编辑。这些编辑和引导方法的一个核心挑战是将特征与目标概念可靠地匹配。目前大多数方法都是通过在已经训练好的冻结字典上计算事后分数来解决这个问题。相反,我们引入了 ClasSAE,这是一种新颖的方法,它既可以自动为特征分配类别,又可以在训练期间引导编码器实现类别可分离的表示。具体来说,我们将可微分的 top-$k$ 运算符应用于具有每个特征预算的可训练特征类亲和力矩阵,将为每个样本选择的特征耦合到它们被训练来表示的类。由于 梯度 流经活动特征的选择而不仅仅是通过它们的大小,因此编码器和亲和力矩阵共同适应而不是适应于单独的阶段。结果是一个既是类可分离又是类注释的字典,不需要事后探测。我们提出了在此框架内实施稀疏性的三种变体,它们在权衡略有不同的情况下实现了可比较的整体性能。在 ImageNet 上使用 CLIP ViT-L/14 嵌入,我们表明学习的亲和力矩阵与根据 留出 数据计算的独立估计的事后要素类矩阵非常一致。该模型还支持仅从编码器和亲和力矩阵进行直接类别预测,无需单独安装分类器,并且其更类对齐的编码器可在目标 探针 扰动评估中改善分离。 https://github.com/St0pien/ClasSAE.
