论文

使用 同策略 熵流优化了解和防止 RLVR 中的熵崩溃

Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)已成为提高大语言模型推理能力的有效范式。然而,广泛使用的 RLVR 算法(例如 GRPO)经常遭受熵崩溃,导致过早确定性和不稳定的优化。现有的补救措施,包括熵正则化和基于比率的裁剪启发式,要么以粗粒度的方式控制熵,要么依赖近似的 同策略 训练。在本文中,我们从 词元级 熵流的角度重新审视熵崩溃。我们的分析表明,熵减少的词元始终超过熵增加的词元,导致熵流严重不平衡。这一观点为现有 RLVR 算法中的熵崩溃提供了统一的解释,并强调了平衡熵动态的重要性。受此分析的启发,我们提出了 同策略 熵流优化(OPEFO),这是一种自适应熵流平衡机制,可根据熵增加和熵减少更新对熵变化的贡献来重新调整熵增加和熵减少更新,同时保持严格的 同策略。六个数学推理基准的实验表明,OPEFO 提高了训练稳定性和最终性能。我们将在发布后发布代码和模型。