论文
解码器余弦相似性无法用于 SAE 特征流发现
Where Decoder Cosine Similarity Fails for SAE Feature Flow Discovery
摘要
基础模型越来越多地通过微调、模型编辑和对齐程序进行调整,同时保留以前获得的功能。因此,了解支持这些适应的内部计算对于模型的持续进化变得越来越重要。稀疏自动编码器(SAE)为残差流激活和子层输出提供可解释的特征字典,但仍不清楚状态特征和更新特征如何相互作用以产生下游残差特征。在这项工作中,我们将 MLP 更新作为第一个测试用例。我们构建了一个三元组 $s_k + u_j \rightarrow t_\ell$ 的转换图集,其中残差状态特征和 MLP 更新特征联合预测目标残差特征,并通过消除解码的更新特征来验证候选三元组。在 20M 词元 Pythia-160M $L_7 \rightarrow L_8$ 运行中,我们发现 38,125 个强消融效应转换,但 88.0% 的状态目标和更新目标解码器余弦相似度都低于 0.7。作为初步的跨模型检查,运行 20M 词元 Gemma-3-4B $L_{21} \rightarrow L_{22}$ 通过消除解码的更新特征,仅因果验证排名前 30,000 个的候选三元组,并且 53.6% 的强效三元组的状态目标和更新目标解码器余弦相似度都低于 0.7。 Gemma 结果在方向上与 Pythia 一致,但较弱,因为更新目标余弦恢复了许多最强的 Gemma 效应,并且运行不是完整的图集因果验证。最终,我们的结果表明,特征流图集可以作为表示更新机制的诊断,从而为指导模型更新提供工具。未来的工作将跨层、模型和 SAE 系列验证更复杂的模式。