论文

ProjQ:针对适配器感知 LLM 压缩的投影和量化

ProjQ: Project-and-Quantize for Adapter-Aware LLM Compression

摘要

后训练 量化 (PTQ) 和低秩适应 (LoRA) 构成了高效 大语言模型 (LLM) 部署的标准管道。然而,按顺序应用它们会带来一个问题:PTQ 通常会留下随机噪声,这些噪声以 LoRA 无法轻松修复的方式(在模型的权重上)分散,这意味着 LoRA 最终会浪费其有限的能力来尝试修复不可纠正的噪声,而不是提高任务性能。在本文中,我们提出了 \textbf{ProjQ},这是一种通过正交子空间投影将量化噪声限制到低秩流形的新颖框架。我们推导出一种有效的交替算法,将量化噪声整形为低秩结构,有效地将主要误差分量卸载到后续适配器,同时最小化正交“不可校正”子空间中的残余误差。我们的理论分析表明,与标准 PTQ 相比,ProjQ 为下游任务保留了更大的模型可塑性。 LLaMA-2、Qwen2.5 和 Qwen3 上的大量实验证实,ProjQ 在量化误差补偿和下游任务 微调 方面始终优于现有方法,实现了高达 $2\times$ 的补偿评估损失降低,并在仅使用 3 位的语言建模任务上与标准 4 位基线的性能相匹配。该代码可在 https://github.com/yy9301/ProjQ 上获取。