论文
PALS:LLM 剪枝的百分位感知分层稀疏性
PALS: Percentile-Aware Layerwise Sparsity for LLM Pruning
摘要
Wanda 和 SparseGPT 等一次性剪枝方法对 Transformer 的每一层应用相同的稀疏率,忽略层重要性的已知变化。我们提出 PALS(Percentile-Aware Layerwise Sparsity),它根据激活幅度的第 99 个百分位数调整每层稀疏性,在目标比率周围限制为 $\pm 5\%$。在 LLaMA-2-7B 上,稀疏度为 50% 时,PALS 的 WikiText-2 困惑度为 10.96,而均匀 Wanda 的困惑度为 12.92(平均超过 9 次运行,$p < 0.001$)。好处取决于架构:LLaMA-3-8B 显示出边际收益,而 Mistral-7B 则没有显示。我们还发现基于梯度的分配(看似更有原则的方法)产生的结果比随机分配更糟糕,这表明梯度大小不能预测离散权重去除的影响。 PALS 给修剪管道增加的成本可以忽略不计,并且不需要 微调。