论文

用于近无损 HiF8 W8A8 量化感知训练的最大窗口尺度估计

Max-Window Scale Estimation for Near-Lossless HiF8 W8A8 Quantization-Aware Training

摘要

采用低位浮点格式的量化感知训练 (QAT) 可实现高效的 LLM 部署,但会引入标准训练指标不可见的微妙故障模式。我们通过延迟张量缩放 (DTS) 的视角,对 OpenPangu-Embedded-1B 的 HiF8 W8A8 QAT 进行了系统研究。在八个受控实验中,我们识别并解开了两种正交故障模式:(i)amax 饱和,其中延迟尺度通过前向剪切估计默默地破坏了知识敏感的表示,以及 (ii) 灾难性遗忘,其中激进的学习率独立于量化覆盖了预先训练的常识知识。仅从训练损失中无法检测到这两种情况。我们在 64 步历史窗口上使用保守的最大算法 DTS 策略解决最大饱和问题,并通过 500 步 BF16 预热和 lr=10^{-5} 处的 QAT 来减轻遗忘。这两个修复都是必要且充分的:与匹配的 BF16 基线相比,我们的最终配置实现了 0.43% MMLU 下降、0.58% HellaSwag 下降和 0.22% ARC-Challenge 下降,并且在 10,000 步中训练损失 APE 仅 0.11%。