论文

少位整数的有符号对称量化

Signed Symmetric Quantization for Few-Bit Integers

摘要

有符号整数字母表比正数多包含一个负数可表示值。然而,按照惯例,标准对称整数量化器将其标度固定为严格正数,这会将这个额外的可表示值分配给负尾部,并可以强制剪裁正异常值。在这项工作中,我们表明,在几位精度下,这种限幅是量化误差的一个重要来源。非对称量化通过零点解决了这个问题,将网格移向观察到的数据范围;然而,众所周知,这种灵活性会带来运行时间的损失。例如,在 AMD EPYC(TM)“Turin”CPU 上的 llama.cpp 中,4 位对称格式使用的内存最多可减少 9%,吞吐量比非对称格式高出 2.45$\times$。我们强调有符号对称量化作为第三个选项,它保留对称量化的运行时配置文件,而不会受到非对称格式的影响:我们的有符号绝对最大网格通过有原则的轻量级符号选择规则将额外的可表示值放置在显性异常值尾部,同时将零点保持为零。我们的理论分析提供了两个主要结果。首先,我们将带符号的absmax网格建立为$\ell_2$量化误差上的条件边界最优,并表明该条件适用于低位宽预训练大语言模型(LLM)中88-99%的权重组。其次,我们证明,对标准对称量化器的标度取反在分析上相当于同一有符号整数字母表上的单位零点移位。我们在 Qwen3、Qwen3.5 和 Llama3 系列模型上凭经验验证了我们的建议,并观察到与标准无符号对称量化器相比,困惑度和下游少样本精度得到了改善,且无需额外的推理成本