论文

修剪、更新和修剪:大语言模型 的稳健结构化修剪

Prune, Update and Trim: Robust Structured Pruning for Large Language Models

摘要

大语言模型 (LLM) 近年来经历了显着的增长和发展。然而,在 LLM 上执行推理仍然成本高昂,特别是对于长上下文推理或在资源受限的设备中。这激励了新的 后训练 修剪(PTP)方法的开发。这些方法通过删除模型参数的大部分来降低 LLM 的要求。丢弃的权重是根据其对模型性能的影响来选择的。当前的 PTP 方法通过从 FFN 层和最不重要的关注层中删除信息量较少的隐藏节点来修剪模型。我们提出了 Putri,一种 PTP 方法,它对最先进的技术引入了三个变化。首先,我们更新 FFN 的未剪枝权重以补偿引入的剪枝误差。其次,考虑到对先前层所做的更新,按顺序修剪 FFN 层。第三,我们不是删除整个注意力层,而是删除单个注意力头。我们扩展了这个方法,使其还可以解决分组查询注意力问题。综上所述,Putri 是一种结构剪枝方法,在保持简单的同时表现出 SOTA 性能。在具有多种稀疏度范围的多个模型和不同数据集上进行的剪枝实验验证了 Putri 的通用性。值得注意的是,我们证明,与以前的方法不同,Putri 可以在极端稀疏率下修剪 LLM。该代码位于:https://github.com/Coello-dev/Putri。