Expander 稀疏自动编码器:用于机械可解释性的参数高效字典
Expander Sparse Autoencoders: Parameter-Efficient Dictionaries for Mechanistic Interpretability
摘要
稀疏自动编码器 (SAE) 通过拟合超完备字典 $\mathbf{W}\in\mathbb{R}^{m\times n}$ 与 $m<n$,将神经网络的内部激活分解为学习特征的稀疏线性组合,并从以下位置推断出稀疏代码 $\mathbf{x}\in\mathbb{R}^n$ $\mathbf{h}\大约\mathbf{W}\mathbf{x}$。这个推理问题与压缩感知的规范设置非常相似,但密集解码器需要 $O(mn)$ 学习值,这在特征数量较多时变得昂贵。我们引入 Expander SAE:TopK SAE,其解码器和绑定编码器在具有 $d\ll m$ 的 left-$d$-常规扩展器掩码上受支持,仅学习 $dn$ 解码器值,同时保持稀疏编码问题 $(m,n,k)$ 固定。相同的结构减少了存储,并将 OMP 中的匹配追踪相关步骤 $\mathbf{W}^\top \mathbf{r}$ 转换为 $O(dn)$ 收集和归约操作。我们的实验表明,在 Pythia-70M/160M、Qwen2.5-3B 和 Llama-3.2-1B 剩余流激活中,不同的 $d$ 跟踪一致的存储保真度边界,并且在最压缩的现代 LM 设置下,$d=7$ 的 Qwen2.5-3B 使用比全密集解码器少 293\times$ 的学习解码器值,同时保留 $84$% 的密集 CE 损失恢复了。控制实验表明,改进的存储保真度权衡是由稀疏、多样化的解码器支持结构驱动的,而不是由较少学习的解码器值驱动的,并且当在匹配的参数计数上比较稀疏和密集解码器时,剩余差距的一部分来自编码器摊销。在理论方面,我们证明展开式和列平坦度足以识别无噪声 $k$ 稀疏码,并且我们推导出 OMP 准确恢复支持的补充充分条件。