论文

通过权重冗余进行无前向 LLM 深度修剪

Forward-Free LLM Depth Pruning via Weight Redundancy

摘要

深度修剪通过删除完整的 Transformer 块来降低 大语言模型 (LLM) 推理成本。基于激活的方法通过前向传递校准数据来收集隐藏状态,而现有的无前向方法分别对每个 Transformer 块进行评分,而不测量块之间的相似性。我们提出了权重冗余剪枝(WRP),这是一种无前向深度剪枝方法,可以根据检查点权重估计层间冗余,以选择没有校准数据或模型前向传递的块。 WRP 比较跨层的注意力输出和 MLP 下投影权重,并将它们的成对相似性与相对投影尺度信息相结合。所得的全对相似性矩阵指导层分组和块选择。在多个剪枝设置、模型族和下游任务中,WRP 始终优于现有的前向自由幅度剪枝,并接近基于激活的方法的性能。