论文
ADMM-Q:用于 后训练 的改进的基于 Hessian 的权重量化器 大语言模型 的量化
ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models
摘要
量化是减少 大语言模型 (LLM) 存储和计算占用空间的有效策略。 后训练 量化 (PTQ) 是压缩 LLM 的领先方法。流行的权重量化程序(包括 GPTQ 和 RTN)在模型实用性方面受到影响,尤其是在激进的量化级别(低于 4 位)下。我们提出了 ADMM-Q,一种考虑分层量化问题的新型权重量化算法。我们的算法基于交替方向乘子法 (ADMM) 的组合变体。我们的算子分割过程不断更新权重,以最小化分层重建误差,同时逐渐强制执行具有收敛保证的量化约束。我们提出了额外的算法增强(例如,惩罚调度、预处理和局部搜索后处理步骤),以使 ADMM-Q 在 LLM 规模上高效。 ADMM-Q 是模块化的,可用作现有量化管道中任何权重量化器的直接替代品:ADMM-Q 完全可与现有技术组合,包括范围裁剪、学习或随机旋转以及激活缩放。在 Qwen3-8B 上使用 ADMM-Q 代替 GPTQ,我们减少了 WikiText-2 在以下方面的困惑:(i) W3A16 仅权重设置 (12.85 $\rightarrow$ 10.06); (ii)W4A8 SmoothQuant 程序(9.29 $\rightarrow$ 8.68); (iii) W2A4KV4 SpinQuant 程序 (66.11 $\rightarrow$ 19.42)。