论文
退一步:前缀重要性比率稳定策略优化
A Step Back: Prefix Importance Ratio Stabilizes Policy Optimization
摘要
强化学习(RL)后训练日益展现出引出大语言模型(LLM)推理行为的强大能力。为训练效率,回放通常以离线(off-policy)方式由旧的采样策略生成,再用于更新当前目标策略。为校正采样策略与目标策略之间的差异,多数现有RL目标依赖token级重要性采样比率,主要因其计算简单且数值稳定。然而,我们观察到,当离策略程度较大时,token级校正常导致训练动态不稳定。本文在离策略条件下重新审视LLM策略优化,证明理论上严格的校正项是前缀重要性比率,而将其松弛为token级近似会诱发RL后训练的不稳定。为在大离策略漂移下稳定LLM优化,我们提出一个简单而有效的目标Minimum Prefix Ratio(MinPRO)。MinPRO用基于前缀中观测到的最小token级比率的非累积代理,替换不稳定的累积前缀比率。在稠密与MoE LLM上、跨多个数学推理基准的大量实验表明,MinPRO在离策略状态下显著改善训练稳定性与峰值性能。