论文
ScopeSAE:具有可解释层选择的模型范围特征发现
ScopeSAE: Model-Scope Feature Discovery with Interpretable Layer Selection
摘要
稀疏自动编码器(SAE)是机制可解释性的核心工具。然而,现有的 SAE 主要是按层进行训练的。因此,建模子空间由层标识固定,与实际驱动每个预测的token层状态无关。我们认为,这种约束导致了在分层 SAE 中观察到的几个限制,包括特征利用率低、字典冗余高以及缺乏直接行为依据的特征。在本文中,我们提出了 ScopeSAE,它通过基于归一化梯度的归因将每个预测归因于其最有影响力的token层状态来选择每个token的建模子空间,并在所得的预测相关子空间上学习特征。根据经验,ScopeSAE 产生的效果我们称之为重建优于原始效果。 SAE 的写回重建产生比原始激活更低的 next-token交叉熵,据我们所知,以前没有针对 SAE 报告过这一结果。通过介入分析和 KL 微调反实验,我们表明这种效应可归因于 ScopeSAE 的预测相关子空间本身,而不是架构变化。 ScopeSAE 进一步提高了现有基于层的基线的有效特征计数、可解释性、利用率和字典冗余,这表明通过预测相关性选择 SAE 建模子空间会产生更有用且具有行为意义的特征。
