论文
ACRL:训练推理差异的自适应控制以实现稳定的强化学习
ACRL: Adaptive Control of Training-Inference Discrepancy for Stable Reinforcement Learning
摘要
由于训练和推理之间的差异,大语言模型 (LLM) 的强化学习 (RL) 训练经常会出现不稳定的情况。这种训练与推理的差异源于两个主要因素:训练和推理引擎之间的架构分离,以及在推理中使用低精度量化与在训练中使用更高精度计算。为了解决训练与推理差异较大引起的训练不稳定问题,我们提出了自适应控制的原理和方法。我们提出自适应控制强化学习(ACRL),自适应地将训练与推理的差异保持在合理的范围内,以确保稳定的 RL 训练。除了稳定性之外,ACRL 本身还增加了策略熵,从而增强了探索并提高了准确性。实验结果表明,当推理引擎使用 FP8 量化时,ACRL 始终将训练与推理差异保持在合理范围内,并稳定 RL 训练。此外,ACRL 不仅与 BF16 基线的准确性相匹配,而且优于重要性采样 (IS) 修复。