论文

AA-SVD:用于 大语言模型 压缩的锚定和自适应 SVD

AA-SVD : Anchored and Adaptive SVD for Large Language Model Compression

模型优化模型压缩

摘要

我们引入了一种基于低秩分解的快速框架,用于压缩 大语言模型,无需重新训练即可快速压缩十亿参数模型。与仅对原始输入进行优化的现有基于因式分解的方法不同,我们的方法同时考虑了两者。除了单层压缩之外,我们还进一步端到端地细化每个 Transformer 块,最大限度地减少块级输出失真,并允许压缩层共同补偿累积的错误。通过将每个压缩层锚定到原始输出,同时对输入分布变化进行显式建模,我们的方法找到了一个低秩近似,可以保持与原始模型的功能等效性。 大语言模型 上的实验表明,我们的方法在压缩比方面始终优于现有的基于 SVD 的基线,在激进的压缩预算下,优势变得越来越明显,而竞争方法会大幅退化或完全崩溃,为高效、大规模模型部署提供了实用的解决方案。