论文
G²PTQ:刷新梯度和 Hessian 改进训练后量化
G$^2$PTQ: Improving LLM Post-Training Quantization with Generalized Gradient Compensation
摘要
训练后量化 (PTQ) 是一种无需重新训练即可减少大型语言模型 (LLM) 的内存和计算占用量的实用方法。基于 GPTQ 的方法已成为事实上的标准,但它们存在两个互补的限制。具有局部、分层目标的方法缺乏全局监督;而具有全局目标的方法从一开始就固定其 Hessian 估计并忽略一阶梯度,因此随着量化的进行,它们的指导会变得陈旧。本文提出了 G$^2$PTQ,这是一个具有广义梯度补偿的统一 PTQ 框架,它在全局监督、分块优化目标下集成了一阶和二阶信息。通过在量化每个 Transformer 块之前刷新梯度和 Hessian 估计,G$^2$PTQ 避免了先前全局方法的陈旧性。此外,为了稳定精确的一阶补偿,我们引入了信任区域缩放机制,该机制动态限制梯度步长以防止权重更新爆炸。最后,我们推导了分块 Hessian 近似和精确梯度补偿的有效实现。各种模型系列和位宽的实验结果表明,G$^2$PTQ 能够更好地与全精度模型对齐,优于最先进的基线。代码位于:https://github.com/G2PTQ/G2PTQ。