论文

最佳 后训练 量化尺度以及在哪里可以找到它们

Optimal Post-Training Quantization Scales and Where to Find Them

摘要

后训练 量化 (PTQ) 通过将权重映射到低位表示来压缩 大语言模型。定义量化网格的缩放因子通常使用简单的、无数据的启发法来选择。在这项工作中,我们提出了 PiSO(分段尺度优化),这是一种利用校准数据在舍入到最近量化下准确有效地计算最佳通道权重尺度的算法。 PiSO 将尺度搜索空间划分为有限多个间隔,在这些间隔上目标允许一个封闭形式的最小化器。我们通过原则启发式将 PiSO 扩展到分组量化,并提出了将尺度优化与误差校正交错的有效策略。在 Llama 和 Qwen 模型上跨多个模型大小和目标权重位宽度进行的实验表明,无论是独立的还是与纠错相结合,困惑度和下游零样本精度都得到了一致的改进。特别是,我们观察到随着目标位宽变窄并且量化变得更具挑战性,好处会增加。