论文
迈向可识别的稀疏自动编码器
Toward Identifiable Sparse Autoencoders
摘要
最近,稀疏自动编码器(SAE)已成为一种有吸引力的工具,用于解释实际神经网络中的表示并与之交互。虽然这是常见的经验民间传说,但我们也从理论上表明,SAE 高度不稳定:不同的训练运行可能会产生不同的概念字典和稀疏代码。我们描述了阻碍现实世界 SAE 稳定性的模型属性,并通过对架构和训练过程进行最小的更改来解决每个问题。这些变化共同产生了可识别 SAE (iSAE) 的两个版本,这是标准 TopK SAE 的变体,具有较低的重建误差和更高的稳定性。我们通过将 SAE 与传统的字典学习方法联系起来,从理论上解释了这种改进,并表明在实践中学习的字典满足近似受限等距条件,使得这些模型中相应的稀疏代码几乎可识别。