论文

单词元稀疏自动编码器功能是否有因果必要?层深度和 SAE 系列效应

Are Single-Token Sparse Autoencoder Features Causally Necessary? Layer-Depth and SAE-Family Effects

模型评测模型行为与机制分析

摘要

稀疏自动编码器 (SAE) 功能用于解释和引导 大语言模型,但没有人测试过功能的因果作用在 SAE 系列中是否稳定。单词元功能在一个词汇项上触发,因此 真值 允许直接比较。我们分析了六个模型和三个 SAE 系列的 3.9M 个特征,并在全层深度进行零消融:它们在解码器空间中的位置紧凑 4.7 倍,并集中在早期层。删除一个会降低模型在 208 个层条件中的 178 个中该标记的 logits,这在多重比较校正后很显着。深度决定了损坏的方式:早期层删除会破坏后面的层,后期层删除会直接改变输出。跨系列因果差异超过系列内规模效应:在相同的基础模型上,GemmaScope 和 BatchTopK 特征是因果锚定的,LlamaScope 特征是局部冗余的。在 LlamaScope 下,词元在 96-98% 的时间内恢复到消融前排名的 2 倍以内。仅更改激活函数会反转该差异的符号,因此训练配方是剩下的候选者:跨家庭声明对训练方法敏感,而不仅仅是激活函数或规模。