论文

SoftWater:Softmax 量化的类别感知速率分配

SoftWater: Class-Aware Rate Allocation for Softmax Quantization

摘要

后训练 量化管道通常会以高精度离开 softmax 输出层。然而,在具有现代词汇的小型 LLM 中,头部保存了所有参数的 15--30%,因此具有 fp16 头部的标称“2 位”模型可以在每个权重中存储数倍的位数。我们将 softmax 层量化作为原始输出分布和量化输出分布之间 KL 散度下的率失真问题。二阶分析揭示了类感知几何:量化误差由特征协方差和类特定的 softmax 曲率联合加权。可分离性近似将 $Kn\times Kn$ Cholesky 替换为每类重新调整一次 $n\times n$ 分解,使晶格可通过连续的干扰消除进行编码,并具有来自单个前向传递的统计数据。由此产生的方法 SoftWater 为频繁、低方差的类提供精细网格,为稀有类提供粗网格,这在 Zipfian 词元分布下存在很大差距。在从 1B 到 32B 的五个模型中,SoftWater 在 60 个测试点中的 59 个测试点上的匹配水头速率上优于已发布的 WaterSIC 量化器(在线性层 WMSE 下接近最佳,但不是输出 KL),不使用该管道的任何改进,并且在 2 位时将水头引起的 KL 降低了 $6.5\times$--$8.3\times$。在具有量化主体的 Llama-3.2-1B-Instruct 上,2 位头会删除 45--60\% 的存储字节,从而增加 $2.9$--$3.7\%$ 的困惑度。由于类端统计数据来自校准数据,因此将校准与部署域相匹配会在整个域中提供最低的 KL。在绑定模型上,4 位头部几乎是无损的,而 2 位头部的复杂度低于 4%,使得此类模型的头部量化变得实用。