论文

Transformer FFN 神经元的稀疏层间依赖性

Sparse Inter-Layer Dependencies of Transformer FFN Neurons

模型评测模型行为与机制分析

摘要

前馈网络(FFN)块占 Transformer 架构中参数和计算的很大一部分,但由于残余流引起的加性叠加,其内部结构仍然难以解释。我们检查 FFN 神经元的激活是否可以通过一组稀疏的先前神经元激活和注意力输出来解释。我们引入了一种 无需训练 归因方法,该方法可以估计上游神经元和注意力输出对目标神经元激活的相对影响。根据经验,跨模型和层,我们发现当所有剩余输入都用平均值掩盖时,先前激活和注意力输出的小子集足以保留高保真度的神经元激活。当考虑到上游层固有的激活稀疏性时,有效稀疏性甚至更大。此外,同时在所有层中应用神经元特定的掩模,使得引起的偏差通过网络传播,使模型的困惑度在中等稀疏水平上基本保持不变。这些结果表明,尽管有密集的参数化,FFN 在神经元级别上仍表现出稀疏且结构化的层间依赖性。我们的方法为电路级可解释性提供了实用的、可扩展的工具,并识别了对有效推理具有潜在影响的候选稀疏路径。