论文

LLM 巨大激活的门控通道

Massive Activation Gating Channel in Large Language Models

模型评测模型行为与机制分析

摘要

大规模激活是一种少数隐藏通道表现出异常大幅度的现象,在大语言模型 (LLM) 中普遍存在。然而,token 在通过预训练的 LLM 传播时产生大量激活的机制仍然知之甚少。在本文中,我们发现大规模激活的出现是由嵌入尖峰前馈网络(FFN)的输入中的单个通道控制的。对于特定的 LLM,该通道的位置是固定的。我们将此通道命名为大规模激活门控通道(MAGC)。当 MAGC 的值足够大(或足够小,取决于 LLM)时,尖峰 FFN 的输出表现出大量激活。检查四个模型系列和不同模型尺寸的六个 LLM,我们验证了 MAGC 的存在和效果。我们进一步对 MAGC 诱导大规模激活的机制提供了理论解释。当 MAGC 的值足够大(或小)时,尖峰 FFN 的输出渐近地减小为混合 FFN 下投影矩阵的几列的二次形式。由于这些列表现出大量激活的形状,因此输出也表现出大量激活。

LLM 巨大激活的门控通道:论文原图
(a) 尖峰 FFN 的输入 $\bm{h}$ 的值。我们用红色突出显示大量激活门控通道 (894)。