论文
通过统一熵控制实现强化学习中的定向探索
Targeted Exploration via Unified Entropy Control for Reinforcement Learning
摘要
强化学习(RL)的最新进展提升了大语言模型(LLM)和视觉语言模型(VLM)的推理能力。然而,广泛使用的组相对策略优化(GRPO)持续受熵坍缩困扰,导致策略过早收敛并丧失多样性。现有探索方法在探索过程中引入额外的偏差或方差,难以维持优化的稳定性。我们提出强化学习统一熵控制(UEC-RL),一个为探索和稳定提供定向机制的框架。UEC-RL在困难提示上激活更多探索,以搜索有潜力且有价值的推理轨迹。与此同时,一个稳定器防止熵不受控地增长,从而在模型巩固可靠行为的同时保持训练稳定。这些组件共同在需要时扩展搜索空间,同时在整个训练过程中保持稳健的优化。在LLM和VLM推理任务上的实验显示,其在Pass@1和Pass@$k$上均持续优于RL基线。在Geometry3K上,UEC-RL相对GRPO取得37.9%的相对提升,表明它在不妨碍收敛的情况下维持了有效探索,并凸显UEC-RL是扩展大模型基于RL的推理的关键。我们的代码发布于 https://github.com/597358816/UEC-RL。
