论文

当平坦最小值失败时:表征 FP32 收敛后 INT4 量化崩溃

When Flat Minima Fail: Characterizing INT4 Quantization Collapse After FP32 Convergence

摘要

后训练 量化 (PTQ) 假设收敛良好的模型是量化就绪模型。我们证明这个假设以一种结构化的、可测量的和以前未表征的方式失败了。使用应用于所有 154 个公开可用的 Pythia-160m 训练检查点的免校准每组 INT4 探针,我们确定了一个三相发散结构:一个快速学习阶段,其中 FP32 困惑度和量化鲁棒性共同提高;一个持续大约 70,000 步的亚稳定平台,其中 FP32 困惑度停滞但 INT4 差距仍然有限;以及一个爆炸发散阶段,其中 FP32 困惑度停滞,但 INT4 差距仍然有限。 INT4 差距从 11% 复合到 517%,而 FP32 困惑度几乎没有变化。至关重要的是,这种分歧并不是在学习率开始衰减时开始的,而是恰恰在 FP32 困惑度收敛到更细粒度的起始预测器时开始,这意味着收敛后权重更新,而不是单独的衰减幅度,才是直接原因。我们进一步表明,INT8 量化在所有三个阶段中都是完全免疫的,特别将机制限制在 16 级 INT4 网格的粗糙度上,并通过直接峰度测量排除权重离群值累积作为机制。最后,我们从预分歧检查点进行了受控分叉实验,比较了九次独立运行中的三种学习率计划(余弦延续、SGDR 热重启和我们提出的振荡锁定)。 SGDR 均匀地加速发散(0/9 成对战胜余弦),而 OLI 稳定的冷相将 INT4 差距平均减少 2.2 个百分点(t = -5.46,p < 0.0001),这表明计划幅度校准(而不是单独的振荡)决定了扰动是否有益或有害。我们的代码、探测实施以及所有 154 个检查点审计结果均公开发布。