论文
LLM 强化学习中超越统一 词元级 信任区域
Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning
摘要
具有可验证奖励的强化学习(RLVR)已成为改进 LLM 推理的标准。然而,现有的 PPO 式信任区域机制通过在所有词元上独立执行统一阈值,仍然与位置无关。这种逐点处理在两个关键方面与自回归生成相冲突。首先,统一阈值忽略自回归不对称性。早期偏差会产生复合序列级漂移,导致静态阈值无法充分调节早期分歧并过度限制后期探索。其次,单独评估 词元级 散度会忽略累积前缀漂移,无论调节历史已经偏离采样策略多远,都会给予相同的散度容差。为了解决这个限制,我们提出了 CPPO(累积前缀发散策略优化),这是一种 词元级 屏蔽规则,它通过两个耦合机制将更新与有限范围的策略改进边界对齐。首先,仓位加权阈值对早期仓位施加更严格的限制,其影响持续时间更长,放松对后期词元的限制。其次,累积前缀预算跟踪历史偏差,动态限制进一步的 词元级 偏差,以防止沿前缀出现复合错误。从经验来看,CPPO 增强了训练稳定性,并显着提高了各种模型规模的推理准确性。