论文
重新思考 LLM 策略优化中的重要性采样:累积词元视角
Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective
摘要
强化学习,包括具有可验证奖励的强化学习 (RLVR),已成为 LLM 后训练 的强大方法。这些方法的核心是 离策略 策略梯度估计中使用的重要性采样 (IS) 比率的设计。现有方法面临着基本的偏差-方差困境:PPO(Schulman 等人,2017)和 GRPO(Shao 等人,2024)采用的 词元级 IS 比率通过忽略前缀状态分布不匹配而引入偏差;全序列比率提供精确的轨迹级校正,但由于每个标记比率的乘法累积而受到高方差的影响,而 GSPO(Zheng 等人,2025)通过长度归一化提高数值稳定性,但代价是偏离精确的全序列 IS 校正。在这项工作中,我们确定了累积词元 IS 比率,即直到位置 $t$ 的每个词元比率的乘积,作为解决这一困境的理论上的原则解决方案。我们证明,在 词元级 策略梯度公式下,该比率为每个 词元级 梯度项提供无偏前缀校正,并且具有严格低于全序列比率的方差。基于这一见解,我们提出了 CTPO(累积词元策略优化),它将累积词元 IS 比率与位置自适应裁剪相结合,根据累积对数比率的自然 $\sqrt{t}$ 增长来缩放对数空间裁剪边界。这会在词元头寸之间产生更一致的正则化。我们在几个具有挑战性的数学推理基准的工具集成推理设置中实施和评估 CTPO,与强大的 GRPO 和 GSPO 基线相比,在两个模型规模上实现了最佳平均性能。代码可在 https://github.com/horizon-LLM/CTPO 获取。