论文

饱和使量化误差相加:带有证书的覆盖模型

Saturation Makes Quantization Error Additive: A Coverage Model with a Certificate

摘要

混合精度量化必须决定模型的哪些部分保持更高的精度。基于灵敏度的方法(例如 HAWQ 和 CoopQ)所共有的一个共同前提是,量化一组层所造成的损失可以根据单独测量的每层或成对的灵敏度来重建。我们在现在部署的 4 位权重和激活精度上测试这个前提,将层集 $S$ 量化为布尔立方体上的集合函数来处理损失 $f(S)$ 的变化,并通过两个经典的基础变化进行分析。该分析得出两个结果。首先,在从部署分布中得出的配置中,$f$ 的 85--93% 的方差仅由每层效应来解释。其次,每层项总和的单调变换再现了 $f$ 的配置排名,最多错序了 2% 的对。我们提出覆盖模型 $f(S)=c\bigl(1-\prod_{i\in S}(1-a_i)\bigr)$,它将 $f$ 的测量方差分布再现到其 $L$ 拟合中断率的几个百分点内。该结构支持配置损失的两个预测器,每个预测器都有 $L+1$ 参数。加法模型是最优的一阶预测器。根据 Parseval 的恒等式,其均方误差等于每层效应无法解释的 $f$ 的方差,我们在全格子上进行测量,在全网络规模下对样本进行估计,并报告每个结果,作为任何加法模型性能的证明。覆盖模型本身是第二个预测器。作为匹配内存的分配器,它们在 30B 到 355B 参数的模型上的比较分配器中获得最低的 KL 散度。在四位以下,所产生的分配继续以预算解决代码和推理任务,其中来自梯度敏感性的分配不再产生终止代。