论文

强化学习中熵控制方法的比较理论分析

A Comparative Theoretical Analysis of Entropy Control Methods in Reinforcement Learning

模型训练强化学习

摘要

强化学习(RL)已成为 大语言模型(LLM)中增强推理的关键方法,但可扩展的训练常常受到策略熵快速崩溃的阻碍,从而导致过早收敛和性能饱和。本文对两种熵控制策略进行了比较理论分析:传统的熵正则化和最近提出的基于协方差的机制。我们在 softmax 参数化下建立了统一的熵动力学框架,表明熵变化由对数概率和 logits 更新之间的协方差控制。我们的分析表明,传统的熵正则化引入了密集的、持久的偏差,它改变了平稳条件,导致策略次优,而基于协方差的方法选择性地正则化高协方差标记的稀疏子集,并在正则化系数退​​火时实现渐近无偏。这些结果为 LLM 训练后的熵控制提供了原则性指导,对于将 RL 扩展到更大的模型和更复杂的推理任务具有影响。