可变位宽量化:学习“更大但更小”语言模型的每组精度
Variable Bit-width Quantization: Learning Per-Group Precision for "Bigger-but-Smaller" Language Models
摘要
低位量化缩小了语言模型,但将精度视为单个全局超参数:每个权重都使用相同的位宽。我们引入了可变位宽量化(VBQ),这是一种训练时间方法,其中每个连续的 64 个权重组通过 Gumbel-Softmax 松弛从 {1,2,4,8} 位学习自己的分辨率,通过交替优化联合训练,为精度 logits 提供干净的、与任务对齐的信号。 VBQ 在各个投影类型中发现了一致的、强烈异构的分配,而不仅仅是跨层,不可能用每层方法来表达:69% 的组崩溃到 1 位,LM 头平均为 1.09 位,而第一个 MLP 块保留约 2.5 位。这种模式足够稳定,可以冻结成固定的配方并重复使用,无需进一步搜索。该方案产生了“更大但更小”的机制:平均位数为 1.82 的 131M 模型在 TinyStories 上达到了困惑度 4.2,在存储空间减少了 3.8 倍的情况下击败了 55M FP16 模型 (PPL 4.4),并让 FineWeb-Edu 上的 1.46B 模型与 593M FP16 控件相匹配,存储空间减少了约 3.7 倍,存储空间增加了 2.5 倍参数。就每字节质量而言,VBQ 的效率比 FP16 高 3.9-8.4 倍。该配方直接映射到打包的低位存储,因此它还加速了推理:使用定制的融合去量化和乘法内核,内存带宽限制的自回归解码在相同输出下速度更快,并且加速比随着规模的增加而增长(在 Apple 芯片上奇偶校验为 131M,1.0B 为 1.9 倍,9B 为 4.7 倍)。分布分析(KL 散度和 argmax-flip 率)揭示了一个惊人的机制:更深的层逐渐自我修复早期层注入的量化误差。这场胜利是从零开始的训练过程中的现象;将搜索经济地扩展到 1.5B 参数之外仍然是开放的。 VBQ 将精度重新定义为一种可学习的、非统一的资源,并表明不均匀地花费固定位预算胜过均匀地花费它。