论文

D-QRELO:通过量化和残差低秩近似对 大语言模型 进行无训练和无数据的增量压缩

D-QRELO: Training- and Data-Free Delta Compression for Large Language Models via Quantization and Residual Low-Rank Approximation

模型优化模型压缩

摘要

受监督的 微调 (SFT) 加速了特定任务 大语言模型 (LLM) 的开发,但由此导致的微调模型的激增会产生大量的内存开销。增量压缩通过保留具有多个压缩增量权重的单个预训练 LLM 来解决此问题。然而,现有方法在使用大规模数据集进行微调的模型上失败了。我们发现较大的 SFT 数据规模会放大 delta 参数幅度、奇异值和熵,从而加剧压缩误差。为了解决这个问题,我们提出了 DQRELO(通过量化和残差低秩进行增量压缩),这是一种新颖的无需训练和数据的增量压缩方法。它结合了粗粒度的一位量化来捕获增量的主要结构,然后采用补偿残差低秩近似来从较小的残差误差中恢复细粒度的细节。在这种具有挑战性的环境下,对跨多个域的密集和 MoE 架构的各种 LLM 进行的实验表明,DQRELO 优于现有方法。此外,我们通过广泛的实证分析建立了增量压缩的关键设计原则,展示了任务难度、架构和层定位如何创建可预测的模式,从而指导生产系统中的最佳压缩策略。