论文
突破压缩瓶颈:从理论到实践
Break Through the Compression Bottleneck: From Theory to Practice
摘要
随着语言模型的参数大小不断增长,需要有效的模型压缩来减少其计算和内存开销。现有的压缩方法存在瓶颈问题:当压缩比增加时,性能会显着下降。低秩分解和量化是两种重要的压缩方法,已被证明可以显着降低 大语言模型 (LLM) 的计算和内存需求,同时保持模型精度。显然,将这两种方法结合起来将突破现有的压缩瓶颈。然而,这两种方法在组合时如何交互仍然是开发人员的一个关键问题,因为许多人认为它们是正交的,这意味着除了每种方法独立引入的错误之外,它们的组合不会引入额外的错误。本文首次提供了低秩分解和量化是非正交的数学证明。我们通过 大语言模型 上的一系列实验验证了这些发现。我们的结果表明这些方法是非正交的,它们的组合会导致性能显着下降。重要的是,我们提出了一种新方法对角粘合法(DAM),它可以有效地结合这两种方法并减轻性能损失。我们的研究为模型压缩提供了深刻的见解,为未来的相关研究奠定了坚实的理论和实验基础。