论文
QUADS:通过双侧量化误差对齐稳定MoE的NVFP4强化学习
QUADS: Stabilizing NVFP4 Reinforcement Learning for MoE via QUantization-error Alignment across Dual Sides
摘要
轨迹采样是MoE大语言模型强化学习的主要瓶颈,因此需要FP8等低精度加速方案。NVFP4结合细粒度缩放和原生W4A4 FP4矩阵乘法,兼顾精度与吞吐量。但论文发现,直接将NVFP4用于MoE强化学习的轨迹采样并不实用:配合BF16训练时,约150步后训练崩溃,采样端与训练端的对数概率差距快速扩大。 训练—推理误差分析及受控消融表明,主要不稳定来源是激活误差,而非权重误差。权重可通过共享量化—反量化路径同步对齐;激活需在线重新计算,粗粒度E2M1网格会放大误差。为此,作者提出双侧量化误差对齐QUADS:训练端采用非对称量化感知训练,对权重进行伪量化,同时保持激活不量化;采样端用残差激活补偿修正高误差通道,保留原生W4A4矩阵乘法。 在多个MoE强化学习基准上,QUADS达到BF16级精度,相对朴素NVFP4强化学习将平均pass@1提高21.49个点,轨迹采样吞吐量比FP8高约16%。