论文
CVPO:通过值方差适应和动态课程学习增强 LLM 强化学习推理
CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning
摘要
强化学习(RL)已成为增强大语言模型(LLM)推理能力的有效方法。然而,现有方法对生成的答案轨迹的反馈精度不够,并且存在问题难度漂移的现象。为了应对这些挑战,我们提出了 CVPO——课程引导的价值方差策略优化。在响应轨迹级别,我们发现 词元级 值方差与探索强度相关。我们的理论分析表明这种方差限制了政策更新的幅度。然后,我们使用估计的轨迹值方差来量化生成中的内在随机性。基于此,我们针对不同的奖励类型设计了一种方差感知的优势调整机制。在问题层面,我们引入了适应问题难度的动态课程加权方法。这有助于模型在每个训练阶段专注于与其当前能力相匹配的任务。实验结果表明,我们的方法优于 VAPO 等强大的基于价值的基线。它实现了更好的性能和更强的探索,从而在跨各种数学任务的语言模型中实现更准确和更强大的推理。