论文
JARQ:联合交替细化量化
JARQ: Joint Alternating Refinement for Quantization
摘要
大语言模型的按组训练后量化器将权重舍入到网格上,该网格不会重新适应生成的整数代码。我们证明这会影响准确性:最佳网格取决于代码,输入相关性耦合不同组的错误,并且有用的代码更改通常会同时涉及许多代码。我们提出了 JARQ ,这是一种插件改进,它从任何分组量化器开始,并用有界的 Babai 提案交替所有组尺度的联合最小二乘拟合,在当前网格上将一组的许多代码移动到一起。该问题是双线性盒约束混合整数最小二乘问题;该求解器是无反向传播的,在精确尺度求解下不会增加分层目标,并保持原量化器的位宽、组、零点和推理成本。在具有 RTN、GPTQ、OmniQuant 和 AWQ 原量化器的 Llama-2、Llama-3 和 Qwen 模型中,JARQ 降低了 96 次比较中的 90 次的困惑度,将三位 RTN 困惑度最多降低36%,提高了 24 次配置中的 23 次的平均多项选择准确度,并改进了 QEP、QuaRot 和 OJBKQ 输出,每个 7B 块的速度不到一分钟。