论文

LLM 层立即相互纠正

LLM Layers Immediately Correct Each Other

模型评测模型行为与机制分析

摘要

语言模型可解释性方面的最新方法采用稀疏自动编码器等技术将残余流贡献分解为线性的、语义上有意义的特征。此类方法通常被解释为识别残留流中持续存在的特征以及后续层构建的特征。我们通过确定 Transformer 层校正机制(TLCM)来挑战这一观点,其中相邻的 Transformer 层系统地抵消彼此贡献的部分。 TLCM 出现在 7 个主要开源模型系列中的 5 个中,并在不同文本中的几乎所有词元上激活。我们表明,TLCM 在预训练期间出现,对上下文相关的标记运行最有力,并根据前一层的输出自适应地校准其校正强度。使用雅可比行列式,我们进一步表明 TLCM 选择性地纠正特定的子空间,同时加强其他子空间,我们通过“提议和拒绝”框架来解释它,其中层提出候选特征,后续层选择性地删除不合适的特征。这种动态表明,任何层的残余流都包含瞬态建议和持久特征,这有助于解释为什么 SAE 特征描述通常具有较低的特异性,为什么有效的模型控制需要极端的特征放大,以及为什么转码器比 SAE 拥有理论上的优势。