论文

BeFOND:稀疏自动编码器中的自然梯度推断与学习

Inference and learning in sparse autoencoders as natural gradient flow

模型评测模型行为与机制分析

摘要

稀疏自动编码器广泛用于揭示神经网络中的可解释特征,但当特征重叠或不频繁激活时,可靠的恢复仍然很困难。这些挑战涉及推断哪些特征解释输入以及学习代表它们的字典。在这里,我们将推理和字典学习统一为自然梯度在共享变分自由能上流动。我们将该框架实例化为 BeFOND,这是一种具有封闭形式推理和学习动态的无编码器稀疏编码模型。我们展示了循环解释如何减少重叠特征之间的干扰,而费舍尔预处理可以补偿稀有特征的缓慢学习。在合成数据上,BeFOND 改进了字典恢复和稀有特征检测,随着叠加的增加,其相对于摊销基线的优势越来越大。在语言模型激活方面,它改进了单特征概念检测和选择性干预,在训练数据大幅减少的情况下优于预训练的参考 SAE。其特征质量随着字典宽度的增加而不断提高,而评估的基线基本上处于稳定状态。总之,这些结果表明,在统一的概率框架内改进推理和学习可以如何更好地利用数据和字典能力来解释和干预神经表示。

BeFOND:稀疏自动编码器中的自然梯度推断与学习:论文原图
图 3:$\mathrm{Be}$FOND 保持最高恢复,并且没有死亡的 潜变量 ($K=4{,}096$)。 3 个种子的平均值和 95% 置信区间。精确值在 C.3.1 节和表 4 中报告。