论文
LLM RL 的预测发散模板
Predictive Divergence Masks for LLM RL
摘要
大语言模型 (LLM) 的强化学习通常依赖信任域掩码来稳定 离策略 更新。占主导地位的 PPO 风格方法将采样词元重要性比用于两个标准:邻近标准,询问策略是否偏离行为策略太远;以及方向标准,询问更新是否将其推得更远。最近的工作 DPPO 通过用行为和训练策略之间的概率差异取代 PPO 基于比率的测试来改进邻近标准。但其方向准则仍然继承自PPO。仅当采样词元重要性比率远离 1 时,才能屏蔽词元。我们观察到,这种基于比率的方向标准是单样本代理,其符号可能与定义接近标准的散度变化不同。因此,我们提出了预测散度掩模,它询问下一个策略梯度步骤是否会增加或减少信任区域使用的相同散度。对于 LLM RL 中使用的离散 softmax 策略,我们以封闭形式导出此预测。由于生产轨迹采样引擎仅公开词汇表的截断(top-K)视图,因此我们为此预测开发了两个轻量级的 top-$K$ 估计器。详细分析表明,与采样比率相比,基于散度的方向更能与已实现的散度变化保持一致,并且生成的掩模可以改善跨模型尺度和精度设置的 RL 训练。