论文
超越稳定-探索困境:LLM 政策优化的环境规范
Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization
摘要
大语言模型 的策略优化(PO)面临稳定性与探索权衡,目前由行动方策略-KL 正则化器调节。这使从业者陷入双重困境:保留Policy-KL会限制响应行为并消耗行动端探索预算,而放弃它会使优化没有明确的漂移控制。我们主张通过将正则化转移到输入端来打破困境的替代方案。随着训练的进行,当前策略引起的训练查询的分布会不受控制地偏离其预强化学习参考分布。具体来说,环境正则化策略优化 (ERPO) 引入了一个 Query-KL (QKL) 术语,该术语限制了该查询分布偏移,以及数据集静态参考派生的每个查询权重,该权重使每个每个查询更新偏向于该参考下的典型查询。 QKL 梯度严格流过查询似然;策略梯度估计器使用的响应评分函数没有出现在 QKL 项中,因此 QKL 对响应分布没有施加直接的梯度压力——保留了探索。 ERPO 插入 GRPO/PPO/REINFORCE 式管道,无需额外的前向传递。在六个数学推理基准上,ERPO 取代了标准的 Policy-KL 正则化器,同时实现了对查询分布漂移的有效控制,在高温解码和长视野训练下提供了更强的准确性和更稳定的行为。我们的源代码可在 https://github.com/AlibabaResearch/ERPO 获取