论文

大语言模型 的端到端强化学习 后训练 的 HiFloat4 格式

HiFloat4 Format for End-To-End Reinforcement Learning Post-Training of Large Language Models

摘要

据我们所知,我们提出了第一个端到端 FP4 RL 后训练,其中部署和训练策略(包括它们的前向和后向传递)都以 4 位精度运行。一项系统研究表明,FP4 RL 退化的主要来源不是训练端量化误差,而是转出激活量化:异常值将动态范围拉伸得很远,以至于在 FP4 下大量激活值下溢到零。与直觉相反,将训练策略恢复到更高的精度,同时保持轨迹采样采用 FP4,会使准确性比完整的 FP4 基线更差,从而将轨迹采样与训练不匹配暴露为主要故障模式,并排除标准的预训练式修复。我们通过 Rollout Residual Quantization (Rollout-ResQ) 来解决这个问题:单个残差校正项受限于硬件友好的稀疏模式,仅添加到 FP4 rollout matmul 中,这是一种轻量级校正,可以恢复因离群值驱动的下溢而损失的大部分精度,而不会增加 rollout 的计算占用量。在 Qwen2.5-3B 和 Qwen2.5-Math-7B 上,Rollout-ResQ 与 HiFloat4 (HiF4) 格式配合使用,其三级分层缩放在 FP4 紧张的 4 位预算下保留了分辨率,将与 BF16 的精度差距从 4.9% 缩小到 1.1%,使完全量化的 FP4 RL 达到全精度。应用到开放标准 MXFP4 上,相同的方法将差距从 13.6% 缩小到 5.3%,这表明 FP4 格式的选择是决定可恢复精度上限的关键因素。总之,这些结果将 HiF4 确立为端到端 FP4 RL 后训练 的启用格式,并将 Rollout-ResQ 确立为激活侧机制,从而缩小与 BF16 的差距。