论文
理解强化学习中的富集
Understanding Enrichment in Reinforcement Learning
摘要
奖励稀疏时,可验证奖励的强化学习(RLVR)常用提示或中间指导生成更多成功rollout。这种富集会使策略梯度更新有偏,除非用重要性权重校正;但现有方法省略校正或截断重要性权重以规避校正的高方差。因此RLVR中校正富集rollout究竟得失何在仍不清楚。我们从数学上证明:省略或截断校正隐式改写了定义的奖励,并把所得梯度误差分解为尺度、旋转与方差以解释其对学习的不同影响。为使校正实用,我们开发新颖的序贯蒙特卡洛(SMC)权重校正机制:在稳定性与粒子序假设下,把标准校正方差沿样本长度的指数复合缓和为加性累积。随后把富集分析应用于解读Qwen3-1.7B在OpenMathReasoning稀疏带上的微调结果,确立富集(校正与未校正)帮助避免稀疏域坍缩的具体机制。主要贡献是总体上理解富集与校正如何影响训练,而非声称任一模式优于未富集RL。