论文
SoLA:利用软激活稀疏性和低秩分解进行 大语言模型 压缩
SoLA: Leveraging Soft Activation Sparsity and Low-Rank Decomposition for Large Language Model Compression
摘要
大语言模型 (LLM) 在各种任务中展示了令人印象深刻的能力,但数十亿级的参数带来了部署挑战。尽管现有方法试图减小 LLM 的规模,但它们需要特殊的硬件支持或昂贵的 后训练 来维持模型质量。为了促进高效且经济的模型瘦身,我们为 LLM 提出了一种新颖的 无需训练 压缩方法,名为“SoLA”,它利用 \textbf{So}ft 激活稀疏性和 \textbf{L}ow-r\textbf{A}nk 分解。根据我们对现代 LLM 前馈网络 (FFN) 中激活模式的分析,SoLA 可以识别并保留对推理有显着贡献的少数组件,同时通过低秩分解压缩大多数组件。为了减轻分解损失,SoLA 配备了自适应分量低秩分配策略,为不同的权重矩阵分配适当的截断位置。我们对 LLaMA-2-7B/13B/70B 和 Mistral-7B 模型进行了各种基准测试的广泛实验。在没有 后训练 的情况下,SoLA 在语言建模和下游任务准确性方面都表现出显着的改进。例如,在 LLaMA-2-70B 模型上压缩率为 30% 的情况下,SoLA 超越了最先进的方法,将困惑度从 6.95 降低到 4.44,并将下游任务准确性提高了 10%。