Qift:用于旋转 W2A4/KV4 LLM 推理的移位友好非零 W2 后训练 量化
Qift: Shift-Friendly No-Zero W2 Post-Training Quantization for Rotated W2A4/KV4 LLM Inference
摘要
2比特权重量化对于内存高效的 LLM 推理很有吸引力,但标准 W2 级别集 {-2,-1,0,+1} 在激进的 W2A4/KV4 设置下通常会崩溃。我们研究哈达玛旋转量化管道中两位权重的标量水平集几何。传统的非对称W2比标准水平集有了很大的改进,这表明W2A4失败不仅是位宽问题,而且是重建水平问题。在 LLaMA-2-7B 和 LLaMA-3.1-8B 中的所有 224 个线性模块中,预训练权重已经接近零中心,而 Hadamard 旋转主要将其标准化形状高斯化:过量峰度和 Q-Q 误差下降了几个数量级。基于这种近似零中心的类高斯源模型,我们提出了 Qift,一个用于旋转 W2A4/KV4 推理的固定非零 W2 水平集。主水平集是{+/-0.5,+/-1.5},相当于半量程重新参数化下的{+/-1,+/-3}; 2 的幂变体使用 {+/-1, +/-4} 进行符号移位解码权重应用。 Qift 重新设计了固定的两位代码到级别的映射,并且是 无需训练、无学习码本、无组网格和无零点,保留了标准的每通道比例。尺度不变比率分析确定了有效的内/外质心比率范围为 0.25 至 0.33,这解释了为什么镜像无零 (MNZ)、Lloyd、NF2 和 PoT-MNZ 表现良好,而 {+/-1, +/-2} 表现不佳。在这两个模型上,与标准 W2 水平集相比,非零水平集始终改善纯 W2A4 困惑度、L 层混合 W2/W4 困惑度、下游精度和 GPTQ 残差行为。在 L=16 混合精度下,它们大大缩小了与 W3A4 的差距,同时将一半的 Transformer 层保持为两位精度,为更复杂的学习 W2 码本提供了一种简单、源感知且易于部署的替代方案。