论文

SLaB:稀疏低秩二元分解实现高效 大语言模型

SLaB: Sparse-Lowrank-Binary Decomposition for Efficient Large Language Models

模型优化模型压缩

摘要

大语言模型 (LLM) 的快速增长由于其大量的计算和内存需求而带来了巨大的部署挑战。虽然模型压缩(例如网络修剪)提供了潜在的解决方案,但大多数现有方法通常无法在高压缩比下保持良好的性能。为了解决这个问题,我们提出了 SLaB,这是一种新颖的框架,它将每个线性层权重分解为三个互补的组件:稀疏矩阵、低秩矩阵和二进制矩阵。 SLaB 消除了重新训练的需要,并利用激活感知修剪分数来指导分解过程。 Llama 系列模型的实验表明,SLaB 实现了最先进的性能,在 50% 压缩下,与现有方法相比,困惑度降低了 36%,并且在零样本任务的基准上,准确率提高了 8.98%。