论文
F-WANDA:Fisher重加权的训练后剪枝支持LLM可持续部署
F-WANDA: Fisher-Reweighted Post-Training Pruning for Sustainable Deployment of Large Language Models
摘要
一次性后训练剪枝是大语言模型中较节能的压缩策略,但现有方法要么牺牲质量(WANDA),要么增加计算成本(SPARSEGPT)。我们提出F-WANDA,作为WANDA的直接替换改动,根据激活前数值的经验Fisher信息,将每行保留预算按比例重新分配到输出神经元。Fisher信号只需在WANDA原有校准语料上增加一次反向传播即可取得,不更新任何权重。在LLAMA-2-7B、50%非结构化稀疏度下,F-WANDA达到WikiText-2困惑度6.85,保持WANDA的流畅性;5-shot MMLU相较WANDA提升1.6个百分点,相较SPARSEGPT提升1.1个百分点,而剪枝耗时与能耗仅为SPARSEGPT的三分之一。无需额外校准数据或微调即可取得这一权衡,使F-WANDA处于可持续LLM压缩的质量与剪枝成本帕累托前沿。