论文
弱化神经元:影响巨大的Transformer中的输入输出功能
Weakening Neurons: An Input-Output Functionality in Transformers with Outsize Influence
摘要
我们分析了大型语言模型 (LLM) 中基于 GLU 的神经元的学习输入输出行为。我们提出了一种简单的分析方法:对于每个神经元,我们计算其输入(读取)和输出(写入)权重向量之间的余弦相似度。在该方案中,强负余弦相似度表明神经元削弱了它在残差流中检测到的方向,因此我们将其称为弱化神经元。这使我们能够获得许多新颖的见解。首先,我们表明九个不同的 LLM 具有相似的模式:弱化神经元主要出现在后期层,而其对应的(条件)强化神经元则频繁出现在早中层。其次,我们发现弱化神经元表现出令人惊讶的行为:尽管数量很少,但它们经常激活并对模型行为产生很大影响。第三,当门值为负时,削弱神经元会对模型输出产生强烈影响——这是令人惊讶的,因为负门值预计不会编码功能。