论文

稀疏自编码器中激活异常值与特征死亡之间的关系

On the Relationship Between Activation Outliers and Feature Death in Sparse Autoencoders

模型评测模型行为与机制分析

摘要

稀疏自动编码器 (SAE) 将神经网络激活分解为可解释的特征,但许多学习到的特征永远不会激活,这个问题称为特征死亡,浪费字典容量并可能重新引入叠加。不同模型之间的死亡率差异很大:GPT-2 上的死亡率接近于零,而具有相同配置的 AlphaFold3 上的死亡率超过 70%。我们发现,维度级激活异常值(平均幅度相对于每个标记变化较大的维度)通过根据每个特征与激活均值的对齐在初始化时移动预激活来导致此问题。与平均数反对齐的特征会收到永久的负预激活并且永远不会触发。我们将异常值严重性形式化为 $γ= \|μ\|/\|σ\|$;它预测了跨越语言、视觉、蛋白质和基因组模型的 454 个模型层组合的初始死亡率(Spearman $ρ= 0.89$ for dead-by-TopK,$0.82$ for dead-by-ReLU)。失效的特征可以在训练期间恢复,但恢复需要 SAE 偏差来学习激活平均值,这个过程在高 $γ$ 时速度非常慢。均值中心化(减去激活均值)回避了这一点,并消除了所有测试模型中异常值引起的死亡,确认了该机制并为何时以及为何需要此预处理步骤提供了原则基础。