论文

通过经验回放对 LLM 进行高效 RL 训练

Efficient RL Training for LLMs with Experience Replay

模型训练强化学习

摘要

虽然体验重放(在训练期间存储卷展并多次重用它们的做法)是一般强化学习中的一项基础技术,但在 LLM 后训练 中,它在很大程度上仍未得到探索,因为人们普遍认为新鲜的 同策略 数据对于高性能至关重要。在这项工作中,我们挑战了这一假设。我们对 LLM 后训练 的重放缓冲区进行了系统研究,将最优设计形式化为陈旧引起的方差、样本多样性和生成的高计算成本之间的权衡。我们表明,当生成成本昂贵时,严格的 同策略 采样并不是最优的。根据经验,我们表明,设计良好的重播缓冲区可以大幅减少推理计算,而不会降低(在某些情况下甚至可以提高)最终模型性能,同时保留策略熵。