论文

CRePE:通过高效搜索进行 后训练 剪枝中卷积感知的相对重要性

CRePE: Convolution-aware Relative Importance in Post-training Pruning with Efficient Search

摘要

在实践中部署 大语言模型 (LLM) 会产生大量的内存和计算成本。 后训练 剪枝 (PTP) 是一种无需额外训练即可消除权重来降低这些成本的有效方法。在现有方法中,RIA 引入了按行和列总和标准化的相对重要性分数,实现了最先进的准确性。然而,RIA 仅考虑一维十字形(行/列)方向信息,并对行和列贡献分配相同的权重。在本文中,我们提出 \textbf{CRePE},它将 2D 局部邻域上下文和自适应系数纳入相对重要性评分中。 CRePE 在不同的模型和稀疏性设置中始终优于现有的 PTP 方法。然而,通过基于困惑度 (PPL) 的爬山来识别最佳自适应系数需要大量的 PPL 评估和大约 11 小时的搜索时间。为了解决这个问题,我们提出 \textbf{PHO} (基于代理的超参数优化),它消除了重复 PPL 测量的需要,并将搜索时间减少到大约 20 分钟。此外,PHO 在一个模型上找到的最佳超参数配置可以很好地转移到其他模型,表现出很强的泛化性。最后,我们验证了 CRePE 可以与现有技术正交结合,包括通道置换、非均匀稀疏分配和重新修剪方法。