论文

Softmax重参数化:在等价输出头中选择更易量化的表示

Softmax Reparameterization for Output-Head Quantization

摘要

大词汇表使输出头成为小语言模型推理成本的重要组成部分。我们提出 Softmax 重参数化,在量化前选择功能等价的输出头。方法从每个输出行中减去词表行均值的一个标量倍数,分别针对 RTN、激活加权 MSE 和完整 Hessian GPTQ,根据验证集 KL 选择系数。这项一维搜索包括原输出头和固定均值中心化,保持全精度 Softmax 分布不变,也不改变已训练的解码器;秩一校正可处理 Soft-capping 等非线性 Logit 路径。在七个输出头上,W4 的改善主要出现在基线量化已明显扭曲预测的情况:Phi-4-mini 的 AW-MSE KL 从 0.936 降至 0.256。在更强 GPTQ 校准下改善仍然存在,并与精确的逐通道缩放和仿射量化互补。在四个输出头和三种 W4 量化器上,冻结由 WikiText 选定的系数后,还能迁移到 C4 和 OpenWebMath:在系数不等于 1 的全部 18 项比较中优于均值中心化,在其余六项中与之相当。在用作压缩压力测试的 W2 下,改善覆盖几乎整个模型与量化器组合。匹配残差分析表明,即使 Logit 重建误差变大,保真度仍可能提高,因为残差的 Fisher 加权成本下降。对支持该平移的输出头,重参数化不增加推理操作,并保持打包 W4 的执行方式;解码器保留 BF16 时,将 Phi 输出头量化为 W4 可使批量为 1 的生成延迟相对 BF16 输出头降低 10.8%。