论文

该分解的地方稀疏,不该吸收的地方密集

Decompose Sparsely Where You Should, Absorb Densely Where You Should No

模型评测模型行为与机制分析

摘要

稀疏自动编码器(SAE)通常被训练为通过稀疏字典重建 \textbf{整个} 残差流,隐式假设所有激活内容都适合稀疏、单义分解。我们质疑这一假设,并假设激活包含低秩、密集组件,该组件在计算上对模型很重要,但本质上不适合稀疏表示,而稀疏表示是在经过训练的 SAE 中广泛观察到的持久密集潜伏的主要来源。为了测试这一点,我们添加了一个与标准 SAE(BatchTopK 和 Matryoshka)并行的小rank-$r$ 线性瓶颈,允许在稀疏重建之前吸收密集结构。在 Gemma-2-2B 第 12 层上,rank-24 瓶颈将密集潜在计数减少了高达 84%,同时在匹配的稀疏度下改进了两种架构上的稀疏探测和目标探测扰动。吸收成分是 (i) \textbf{结构上可识别} 作为顶部主成分和离群维度; (ii) \textbf{因果必要},删除它会使下一个词元交叉熵提高 7.5$\times$,远远超过删除几何上几乎相同的 top-24 PCA 方向的 2.8$\times$; (iii) \textbf{由稀疏字典冗余编码},消融 787 个最大对齐的稀疏特征,交叉熵仅提高 2.9$\times$,并消融 2,048 个主题对齐的特征,使 MMLU 主题分类几乎保持不变,而删除脚手架则将其从 98.7\% 降低到偶然性。总之,我们的研究结果确定了残差流激活的一个紧凑的、语义信息丰富且因果重要的组成部分(我们称之为 \textbf{计算支架}),标准稀疏字典无法有效地表示该组成部分,这表明基于稀疏性的可解释性方法的范围值得仔细重新检查。