论文
稀疏自编码器表示中的特征竞争:LLM 中不确定性驱动的特征竞争的机制研究
Feature Rivalry in Sparse Autoencoder Representations: A Mechanistic Study of Uncertainty-Driven Feature Competition in LLMs
摘要
稀疏自动编码器 (SAE) 将 大语言模型 表示分解为可解释的特征,但这些特征在不确定性下如何相互作用仍然知之甚少。我们引入特征竞争——负相关的 SAE 特征对——并使用 Gemma Scope SAE 研究竞争是否作为 Gemma-2-2B 中模型不确定性的机械特征。通过按响应熵分割 PopQA 的受控域内实验,我们发现相对于低熵问题(分别为 p=5.3x10^-26 和 p=5.8x10^-5),高熵问题在第 0 层和第 12 层产生明显更强的特征竞争,将不确定性局部化到残差流中的特定处理阶段。然后,我们通过沿着竞争轴的激活转向来测试竞争是否是模型输出的因果上游——发现在 20 个竞争特征对中的 15 个中,沿着竞争方向 (vec_A - vec_B) 的转向比低转向乘数的随机方向导致更多的输出变化。最后,从主动 SAE 特征解码器向量的成对余弦相似度导出的每个提示竞争分数可预测答案正确性 (AUROC=0.689),接近但不匹配 softmax 置信度 (AUROC=0.808)。