论文

面向大语言模型的完整管道 FP8 强化学习

Towards Full Pipeline FP8 Reinforcement Learning for LLMs

模型训练强化学习

摘要

强化学习(RL)已成为提高大型语言模型(LLM)推理和代理能力的关键技术。尽管 FP8 量化可以加速 RL 训练,但保持整个 FP8 RL 流程的稳定性仍然具有挑战性。虽然之前的工作重点是使用 TIS 等校正技术解决训练推理不匹配问题,但我们发现全流程 FP8 RL 仍然面临严重的训练不稳定问题,表现为异常的训练中期熵激增和乱码输出。我们将这种不稳定性追溯到一个之前被忽视的原因:复合 FP8 量化噪声扭曲了重要性比,不成比例地将负优势词元推到信任区域之外,并错误地将其梯度归零。因此,病态输出没有受到适当的惩罚,并且在训练过程中不断累积。为了解决这个问题,我们提出了校准裁剪,这是一种动态方法,通过匹配下限裁剪分位数并相应地重新平衡上限,将 FP8 裁剪边界与高精度 BF16 分布对齐。 GRPO 和 DAPO 算法、从 8B 到 32B 的模型规模以及多个 FP8 缩放粒度的广泛实验表明,我们的方法成功消除了熵激增并恢复了与 BF16 基线相当的性能。