论文
困惑成本低估了激活量化的破坏
Perplexity Cost Understates What Activation Quantisation Breaks
摘要
激活量化通常使用聚合指标(困惑度)进行评估,对模型预测的每个标记进行平均。我们询问该平均值是否可以识别量化器损坏的计算。事实证明,困惑度是一个可靠的聚合信号:在来自四个系列的 12 个模型和 780 个模型内比较中,困惑度偏好在除 2.1% 和 4.0% 的案例之外的所有案例中也保留了更多的归纳和更多的检索。但在困惑度仅上升 1.2 至 1.5 倍的情况下,归纳法仍保持 0.959 的完整准确率,而检索则已降至 0.554,这一差距在总数上并未显现出来。这种差距有结构,而不仅仅是大小:对相同的每通道幅度进行匹配的高斯噪声控制使其基本上完好无损,并且仅随机化量化误差的符号,每个幅度保持固定,几乎同样无害,因此幅度本身并不能解释损坏。在旋转基础上进行量化,在不改变误差幅度的情况下改变坐标对齐,在单块干预中每个标记的三个平均位将归纳从 0.001 恢复到 0.980,尽管在相同设置 (0.694) 下检索恢复不太完全;端到端在四个平均位上,归纳达到 0.968,检索达到 0.534。该模式适用于另外两个高达 32B 参数的模型,并且在我们测试的部署配置中,一旦激活被推送到 4 位,就会在 AWQ 下。困惑度目标限制了应用于激活的转换的平均成本;它本身并不显示哪些计算幸存下来。