论文
ReQAT:通过 4 位浮点量化感知训练实现全精度推理精度
ReQAT: Achieving Full-Precision Reasoning Accuracy with 4-bit Floating-Point Quantization-Aware Training
摘要
大型推理模型(LRM)通过长思路实现强大的问题解决能力,但其部署受到全精度推理的高成本和不断增长的 KV 缓存占用的限制。微型FP4格式可实现高效的FP4部署;然而,完全量化权重、激活和 KV 缓存 (W4A4KV4) 会导致严重的推理退化,现有的 PTQ 和 QAT 无法恢复。我们发现 FP4 失败集中在低熵标记上——精确的符号承诺,例如数字和运算符——其中量化噪声会夸大通过推理轨迹级联的采样误差。基于这一见解,我们提出了 ReQAT,这是一种以推理为中心的 FP4 训练框架,包含三个组件:(i)跟踪对齐 QAT(TAQ),它重新访问相同的推理跟踪,以将更新重点放在关键的低熵决策上; (ii) 选择性熵最小化 (SEM),增强低熵位置的置信度; (iii) Q-FIT,一种量化友好的初始化,联合校准 RoPE 一致的 KV 缓存转换以稳定 QAT。在相同的训练预算下,ReQAT 不仅恢复了甚至超越了 BF16 微调 的准确性,同时在 NVIDIA DGX Spark 上实现了高达 3.9 倍的吞吐量加速,在 B200 上实现了 3.1 倍的吞吐量加速。