论文
LLM 深度压缩的局部感知冗余修剪
Locality-Aware Redundancy Pruning for LLM Depth Compression
摘要
众所周知,大语言模型 包含跨网络深度的表示冗余,这使得深度剪枝成为提高推理效率的有效方法。现有的一次性剪枝方法依赖于局部层重要性或跨架构的固定冗余假设。我们提出了局部感知冗余剪枝(LoRP),这是一种由表示局部性引导的 无需训练 一次性深度剪枝框架。我们证明,层间冗余可以是局部的,也可以是全局分布的,具体取决于 LLM 架构。为了描述这种现象,我们引入了表示局部性得分(RLS),它源自全局层间隐藏状态相似性。 LoRP 使用小型校准集计算成对层相似度,通过表征相似度对层进行聚类,并根据残留的簇内冗余分配剪枝。不同 LLM 系列的实验表明,困惑度和下游任务准确性都有所提高。官方github存储库:https://github.com/daniel-eai/LoRP-Locality-Aware-Redundancy-Pruning/