论文

通过统一熵控制实现强化学习中的定向探索

Targeted Exploration via Unified Entropy Control for Reinforcement Learning

模型训练强化学习RLVR

摘要

强化学习(RL)的最新进展提升了大语言模型(LLM)和视觉语言模型(VLM)的推理能力。然而,广泛使用的组相对策略优化(GRPO)持续受熵坍缩困扰,导致策略过早收敛并丧失多样性。现有探索方法在探索过程中引入额外的偏差或方差,难以维持优化的稳定性。我们提出强化学习统一熵控制(UEC-RL),一个为探索和稳定提供定向机制的框架。UEC-RL在困难提示上激活更多探索,以搜索有潜力且有价值的推理轨迹。与此同时,一个稳定器防止熵不受控地增长,从而在模型巩固可靠行为的同时保持训练稳定。这些组件共同在需要时扩展搜索空间,同时在整个训练过程中保持稳健的优化。在LLM和VLM推理任务上的实验显示,其在Pass@1和Pass@$k$上均持续优于RL基线。在Geometry3K上,UEC-RL相对GRPO取得37.9%的相对提升,表明它在不妨碍收敛的情况下维持了有效探索,并凸显UEC-RL是扩展大模型基于RL的推理的关键。我们的代码发布于 https://github.com/597358816/UEC-RL。

通过统一熵控制实现强化学习中的定向探索:论文配图
图1:UEC-RL示意——以统一熵控制平衡探索与稳定,将熵维持在最优运行区间,实现强化学习中的定向探索。