论文
GRASPrune:面向大语言模型预算约束结构化剪枝的全局门控
GRASPrune: Global Gating for Budgeted Structured Pruning of Large Language Models
摘要
大语言模型(LLM)的服务成本高昂,因为模型参数、注意力计算和KV缓存带来可观的内存与延迟开销。我们提出GRASPrune,一个在预训练后应用的结构化剪枝框架,在单一全局预算下联合剪除FFN通道与KV头组。GRASPrune不再无约束地学习重要性分数、待训练结束后才施加预算,而是用投影直通估计器学习轻量门控分数,在每一步都强制施加满足预算的硬掩码,同时保持骨干权重冻结。掩码固定后,我们在保留单元上校准缩放因子以缓解剪枝造成的尺度失配,并将这些因子折叠进剪枝后的权重,得到推理时无任何额外参数的更小稠密检查点。在LLaMA-2-7B上,GRASPrune剪除50%的参数,在WikiText-2上达到12.18困惑度,并在五个基准上保持有竞争力的平均零样本准确率——仅用512条无标注校准序列训练四个epoch,在单块NVIDIA A100 80GB GPU上完成,全程无需任何全模型微调。
