论文
分解 LLM 强化学习的 MXFP4 量化误差:可减少的偏差、可恢复的死区和不可减少的下限
Decomposing MXFP4 quantization error for LLM reinforcement learning: reducible bias, recoverable deadzone, and an irreducible floor
摘要
MXFP4 算法可以显着加速 大语言模型 (LLM) 的强化学习 (RL) 后训练,但量化误差会导致严重的精度下降。现有的工作将量化误差视为整体噪声项,在解释量化误差如何损害训练时缺少独特的机制。我们证明了量化误差的精确三向分解,并展示了每个组件如何主导不同的 RL 训练路径。我们的理论和实证分析将 MXFP4 量化误差分解为三个附加分量:来自二次幂舍入的“比例偏差”、来自将小值归零的“死区截断”以及来自舍入到最近的 4 位网格的“网格噪声”。每个组件都主导着一种不同的 RL 故障模式:尺度偏差通过后向传播乘法累积,影响梯度精度;死区截断会降低采样轨迹质量;网格噪声会提高策略的熵。我们结合了针对 RL 故障模式但不排除组件的修正:宏块缩放以减少规模偏差,异常值回退恢复死区条目,但也部分减少规模偏差引起的错误,以及用于控制策略熵的自适应量化噪声(AQN)。在 Qwen2.5-3B 密集模型和 Qwen3-30B-A3B-Base 专家混合模型上,目标校正将 BF16 精度恢复到 0.7% 以内,并分别超过 BF16 +1.0%。