论文

ReQuant:面向训练后量化的固定网格离散精化

ReQuant: Fixed-Grid Discrete Refinement for Post-Training Quantization

摘要

训练后量化(PTQ)被广泛用于降低大语言模型的内存与计算成本。现有PTQ方法通常通过启发式规则或贪婪优化获得初始量化模型,且一旦量化完成,所得整数分配通常被视为最终结果。这一观察促使我们在PTQ内部引入一个互补的优化阶段:在可执行量化模型产出之后,保持量化权重仍可改进,同时保留量化格式。我们提出ReQuant,一个面向该阶段的免反向传播固定网格精化过程。ReQuant与PTQ初始化方法无关,以现有量化模型为可行起点,在固定量化网格上迭代重访其离散权重分配。被接受的更新严格降低均方重构误差并保持在原网格上。这样,ReQuant把最初固定的PTQ输出转化为可迭代优化的离散解,并可作为现有PTQ流水线的即插即用后处理阶段。在多个模型家族、位宽和下游任务上的实验表明,ReQuant持续改进来自异构PTQ初始化器的量化模型,在简单初始化器和更低位宽下增益尤其大。值得注意的是,ReQuant可对简单的就近取整初始化进行多轮精化,直到在相同量化格式下接近或超越GPTAQ。这些结果确立了ReQuant作为进一步改进现有PTQ流水线的实用互补阶段的地位。

ReQuant:面向训练后量化的固定网格离散精化:论文配图
图1:ReQuant概览。ReQuant通过在固定量化网格上迭代更新离散权重赋值来精化初始PTQ模型,在保持量化格式的同时改善重建误差。