论文

压缩三位一体:面向LLM压缩的稀疏化、量化与低秩近似探索

Compression Trinity: Exploring Sparsity, Quantization, and Low-Rank Approximations for LLM Compression

模型优化模型压缩

摘要

高昂的计算与环境成本阻碍了大语言模型(LLM)的可扩展部署。传统压缩技术(稀疏化、量化、低秩近似)通常被单独应用,且各自都会撞上精度-效率之墙。本论文提出“压缩三位一体”(Compression Trinity),一个联合应用三大支柱的统一框架:稀疏化用于减少计算,量化用于最小化内存带宽,低秩近似用于恢复精度。为加速预训练,我们将三位一体应用于优化器和模型架构。MKOR通过块对角稀疏化和低秩求逆来近似曲率,并为量化状态保持数值稳定性;它将曲率更新复杂度从O(d^3)降至O(d^2),相比KFAC加速收敛最高达1.85倍。SLoPe通过面向N:M稀疏的双剪枝反向传播加速训练最高达1.25倍,并在训练最后1%阶段使用低秩“惰性”适配器恢复精度。对于训练后压缩,OPTIMA通过将权重重构表述为全局最优的逐列二次规划,在零训练条件下稳定静态掩码,零样本精度最高提升3.97%。在给定微调预算时,PATCH通过学习0%到50%之间的动态混合稀疏率突破静态掩码天花板,取得最高1.38倍加速。最后,SLiM一次性实现完整的压缩三位一体,使用数学推导的低秩适配器恢复量化和稀疏损失的信息,相比最先进方法精度最高提升5.66%,并在同等参数预算下超越未压缩稠密模型0.6%。这些结果共同表明,联合应用压缩三位一体对实现高效、可扩展、高性能的LLM至关重要。