论文

低位量化会破坏哪些决策以及如何预测它们

Which Decisions Low-Bit Quantization Breaks, and How to Predict Them

模型评测模型行为与机制分析

摘要

量化通过用更少的位数存储模型权重来节省内存。它还可以改变模型决策,例如是否调用工具或从有限集中选择哪个选项。我们在 8 个系列的 16 种语言模型中以 4、3 和 2 位、跨多种 后训练 量化设置研究这些决策变化。我们的评估涵盖工具使用、安全性、常识和社会偏见,使用 BFCL、XSTest、MMLU、BoolQ、BBQ 和综合任务。决策裕度是两个可能的第一个标记之间的分数差异,在量化之前和之后测量。将量化前的裕度写为 $m$,将量化后的裕度写为 $m'$,我们发现决策之间存在近似线性关系:$m' \approx c m + b$。斜率 $c$ 通常低于 1,并且随着精度下降而变得更小,因此量化会逐渐缩小决策裕度。对于一种类型的每个决策,偏移量 $b$ 都是相同的。因此,量化并不是简单地添加随机噪声,甚至在全精度下的强烈偏好也可能发生翻转。量化还不同程度地影响不同类型的决策。在工具使用中,是否调用工具通常比调用哪个工具更敏感:在 400 个 BFCL 任务中,五分之三的模型在 3 位舍入到最近值时比正确的工具选择丢失更多的已完成调用。在 GPTQ 和 GGUF 下,与普通舍入相比,是否调用决策翻转要少得多,因此不存在单个 3 位故障点。同样的关系可以预测决策翻转的频率。在评估中得出的模型、量化设置、位宽和决策类型的 1,154 种组合中,我们对一半决策拟合了拟合线周围的斜率、偏移和散布,并预测另一半决策的翻转率。预测的翻转率与观察到的翻转率的中位数相差 1.0 个百分点。