论文
用于有效机械解释的子空间感知稀疏自动编码器
Subspace-Aware Sparse Autoencoders for Effective Mechanistic Interpretability
摘要
稀疏自动编码器 (SAE) 广泛用于 大语言模型 中的机械可解释性,但其公式为每个潜在特征分配单个解码器方向,隐式假设特征是一维的。我们证明这种假设与模型特征的多维结构不匹配,可证明通过两种不同的机制引起特征分裂。从几何角度来看,用单向解码器将固有维度 $d_i \ge 2$ 的特征重构为错误 $\varepsilon$ 会迫使原子数量在 $d_i$ 中呈指数增长。从端到端优化的角度来看,这种拆分不仅是可能的,而且是积极优选的。我们证明,存在从真正的 $d_i$ 维基础到严格较低风险的 $\ell_1$ 正则化 SAE 目标的连续路径,其下降方向将任何经过训练的字典驱动到该指数状态。因此,单个相干特征在许多近共线的潜在特征中被分割,产生虚假的多重性并模糊了内在的几何形状。受此启发,我们引入了子空间感知稀疏自动编码器(SASA),它用学习的解码器子空间替换单向量解码器,通过 Top-$s$ 组门控强制块稀疏性,并使用核范数正则化器调整每个组的有效秩。然后我们表明,一旦块大小满足 $r \ge d_i$,单个组不仅可以表示整个特征切片,而且是 SASA 目标的全局最小化器。这种整合产生了 $d_i$ 的样本复杂度多项式,而不是指数 - 这是一个决定性的优势,因为每次训练激活都会花费 LLM 前向传递。根据经验,在 GPT-2 和 Mistral-7B 上,SASA 减少了特征分割和吸收,提高了单义性和可解释性,并在大约一半的 词元预算 上进行训练时匹配或超过了标准 SAE。