论文
超级节点和光环:LLM 前馈层中的损耗关键中心
Supernodes and Halos: Loss-Critical Hubs in LLM Feed-Forward Layers
摘要
我们研究了 Transformer 前馈网络(FFN)中通道级重要性的组织。使用基于激活梯度二阶矩的 Fisher 式损失代理(LP),我们表明损失敏感性集中在每层内的一小组通道中。在 Llama-3.1-8B 中,每层前 1% 的通道占 LP 质量中位数的 58.7%,范围为 33.0% 至 86.1%。我们将这些损失关键的通道称为超级节点。尽管 FFN 层也包含强激活异常值,但 LP 定义的超级节点仅与激活定义的异常值轻微重叠,并且不能单独用激活功率或权重范数来解释。围绕这个核心,我们发现了一个较弱但一致的光环结构:一些非超级节点通道共享超级节点的写支持,并与受保护的核心表现出更强的冗余。我们使用一次性结构化 FFN 剪枝作为该组织的诊断测试。在 FFN 稀疏度为 50% 时,修剪许多超级节点的基线急剧退化,而我们的 SCAR 变体明确保护超级节点核心;最强的变体 SCAR-Prot 的困惑度达到 54.8,而 Wanda-channel 的困惑度为 989.2。 LP 浓度模式出现在 Mistral-7B、Llama-2-7B 和 Qwen2-7B 中,在目标 Llama-3.1-70B 实验中仍然可见,并在 OLMo-2-7B 预训练期间增加。这些结果表明,LLM FFN 开发了一个丢失关键通道的小型学习核心,并且保留该核心对于可靠的结构化修剪非常重要。