论文

TriSP:面向大语言模型的三信号结构化剪枝

TriSP: Tri-Signal Structured Pruning for Large Language Models

摘要

大语言模型(LLM)在多样任务上表现强劲,但其部署受制于参数带来的内存和计算成本。结构化剪枝通过移除注意力头和多层感知机(MLP)神经元等完整结构来应对,产出能在标准硬件上高效运行的更小稠密模型。然而,现有方法要么依赖内存开销高得令人却步的梯度重要性估计,要么依赖无法直接度量移除对损失影响的基于激活的统计代理;此外,重要性准则与剪枝后恢复策略之间的相互作用也缺乏系统研究。我们提出 TriSP(三信号结构化剪枝),一种将按激活范数缩放的权重幅度与一阶梯度敏感度通过几何平均结合的重要性度量,产出同时捕捉结构信号与损失敏感度信号的通道级分数。结合自适应的逐层预算分配和低秩适配(LoRA)恢复,TriSP 在所有受测配置中取得最低困惑度和最高零样本准确率,在 LLaMA-7B 的 20% 剪枝下达到 6.80 的 WikiText-2 困惑度。在 50% 剪枝下推理吞吐量提升 82%,同时保持有竞争力的性能。

TriSP:面向大语言模型的三信号结构化剪枝:论文配图
图 1:拟议的 TriSP 结构化修剪流程概述。 (1) 结合校准数据中的权重大小、梯度灵敏度和每个通道的激活范数,计算三信号重要性得分 Sl,jS_{l,j}、WIFNl,j 和 GSl,j 的几何平均值; (2) 通过 z 分数归一化来标准化跨层分数并应用统一阈值; (3)物理去除剪枝头和具有自适应每层保留率的神经元,然后将LoRA适配器注入冻结的剪枝权重中,并在微调后合并。