论文

fmxcoders:用于跨层特征发现的因子化屏蔽交叉编码器

fmxcoders: Factorized Masked Crosscoders for Cross-Layer Feature Discovery

模型评测模型行为与机制分析

摘要

预训练 Transformer 中的许多特征跨越多个层:它们通过推理阶段出现、保留在残差流中或由并行 MLP 联合构建。交叉编码器(即跨层联合训练的稀疏字典)旨在在单个共享潜在空间中恢复这些跨层特征。我们表明,标准交叉编码器在很大程度上未能达到此目的。尽管它们的解码器权重规范在各层之间均匀分布,但我们引入的功能一致性度量表明,每个潜在层的激活平均仅由一层或两层有效驱动。虽然功能上相干的潜伏充当人类可解释的概念检测器(例如,美国的州和城市),但交叉编码器主要学习的层局部潜伏会崩溃到表面级模式,例如数字检测器。我们将这种失败归因于两个结构限制:无约束的跨层参数化和无规则的跨层依赖性。我们通过引入 fmxcoder 来解决这两个问题,它(i)用低秩张量分解替换编码器和解码器,从共享的跨层基础中提取每个潜在层的每层权重,并且(ii)应用随机层掩蔽,这是沿层轴的去噪正则化器,它会惩罚当单层被掩蔽时其贡献崩溃的潜在层。在 GPT2-Small、Pythia-410M、Pythia-1.4B 和 Gemma2-2B 中,fmxcoder 将平均探测 F1 提高了 10-30 个点,超过了标准交叉编码器无法达到的每层 SAE 基线,将重建 MSE 减少了 25-50%,并且大致使平均功能一致性提高了一倍。 LLM 作为法官的评估进一步表明,在所有四个基础 LLM 上,fmxcoder 比标准交叉编码器恢复了 3-13$\times 多的语义连贯潜伏。