论文

稀疏低语者

The Sparsity Whisperer

摘要

剪枝降低了 大语言模型 的推理成本,但现有标准主要保留大型激活或重建层输出。我们认为,这忽略了 MLP 上投影和门投影中对稀疏性敏感的神经元执行的关键计算:将相似的输入分离为不同的输出。这表明有效的修剪不仅应该保留激活,还应该更广泛地保留输出之间的差异。我们引入了一系列基于此原理的基于差异的修剪方法。 Wisp 是一种一阶、免更新方法,它使用输入差异范数对权重进行评分,而 Wisp+ 使用每个神经元分离最强烈的输入对来神经元地细化此分数。最后,Whisper 是一种二阶方法,使用轻度正则化的差分 Hessian 作为其重建目标。在从 7B 到 405B 参数的 Llama 2 和 3.1 模型中,我们的二阶变体始终优于基于强重建的基线,而我们的免更新变体则优于激活感知基线,尤其是在受限设置中。相对于 Wanda 和 SparseGPT 的改进扩展到结构化稀疏性、下游评估和其他模型系列。通过我们的差异信息标准增强 RIA 和 ALPS 等更强大的技术,可以产生进一步的改进,以微不足道的额外成本将整体准确性运行时前沿向外移动。这些结果表明,保留输出差异对于 后训练 LLM 稀疏化来说是一种广泛有用且可组合的信号。