论文

强化中的熵极性 微调:方向、不对称性和控制

Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control

模型训练强化学习

摘要

策略熵已成为理解和控制 LLM 的可验证奖励强化学习 (RLVR) 探索的基本度量。然而,现有的熵感知方法主要通过全局目标来调节熵,而采样策略更新重塑策略熵的 词元级 机制仍未得到充分探索。在这项工作中,我们开发了 RLVR 熵力学的理论框架。我们的分析产生了熵变化的一阶近似,从而产生了熵极性,这是一个带符号的 词元级 量,可以预测采样更新扩展或收缩熵的程度。该分析进一步揭示了结构性不对称性:强化频繁的高概率词元会引发收缩趋势,而扩张趋势通常需要较低概率的样本或更强的分布校正。根据经验,我们表明熵极性可靠地预测熵变化,并且正负极性分支在保护探索同时加强利用方面发挥着互补作用。基于这些见解,我们提出了极性感知策略优化(PAPO),它保留了极性分支并通过优势重新加权来实现熵控制。以经验熵轨迹作为在线相位信号,PAPO 自适应地在熵扩展和熵收缩更新之间重新分配优化压力。数学推理和代理基准实验表明,PAPO 始终优于竞争基准,同时提供卓越的训练效率和显着的奖励改进。