论文

理解免训练大语言模型低秩压缩中的校准与截断误差传播

Understanding Calibration and Truncation Error Propagation in Training-Free Low-Rank Compression for LLMs

模型优化模型压缩

摘要

免训练低秩压缩框架因能在保持任务级准确率的同时有效减少模型参数量,而在大语言模型压缩中日受重视。然而,现有SOTA框架存在两个共同的关键局限:(1)校准数据激活中的残差误差在压缩过程中跨层累积,导致压缩时模拟的表示与推理时经历的表示错位;(2)压缩后层重要性分布保持不变的假设并不成立。这两种效应共同导致压缩过程相对部署模型的错位。我们研究这些效应,并提出一种与现有框架兼容的简单免训练方法来缓解它们,包括:(1)带校准修正的逐层压缩;(2)带秩分配修正的迭代压缩。在现有SOTA分解框架之上实现,并在多个基准与压缩率下对Llama与Qwen3模型评估,我们的方法在零样本任务上相对逐权重与联合分解基线最多提升约1-2.5个准确率点。