论文
MetaSAE:具有可分解性惩罚的联合训练会产生更多原子稀疏自动编码器潜伏
MetaSAEs: Joint Training with a Decomposability Penalty Produces More Atomic Sparse Autoencoder Latents
摘要
稀疏自动编码器 (SAE) 越来越多地用于安全相关应用,包括对齐检测和模型引导。这些用例要求 SAE 潜伏尽可能原子。每个潜在的应该代表从单个底层表征子空间中提取的单个连贯概念。在实践中,SAE 潜伏将表征子空间混合在一起。单个特征可以跨语义不同的上下文激活,而这些上下文不共享真正的通用表示,从而使本已复杂的模型计算图变得混乱。我们引入了一个联合训练目标,直接惩罚这种子空间混合。一个小型元 SAE 与主 SAE 一起训练,以稀疏地重建主 SAE 的解码器列;当主要 SAE 的解码器方向很容易从元字典中重建时,它就会受到惩罚。每当潜在方向位于由其他主要方向跨越的子空间中时,就会发生这种情况。这会产生朝向更加相互独立的解码器方向的梯度压力,从而抵抗稀疏元压缩。在 GPT-2 Large(第 20 层)上,相对于在相同数据上训练的相同单独 SAE,所选配置将平均 $|\varphi|$ 减少了 7.5%。自动可解释性(模糊测试)分数提高了 7.6%,提供独立于训练和共现指标的原子性增益的外部验证。重建费用并不高。 Gemma 2 9B 的结果是有方向性的。在未完全收敛的 SAE 上,相同的参数化会产生最佳结果,$+8.6\%$ $Δ$Fuzz。虽然是定向的,但这是一个令人鼓舞的迹象,表明该方法可以转移到更大的模型。定性分析证实,在多语义标记上触发的特征被分为语义上不同的子特征,每个子特征专门针对不同的表示子空间。