论文

平衡万岁:信息瓶颈驱动的基于树的策略优化

Long Live The Balance: Information Bottleneck Driven Tree-based Policy Optimization

模型训练强化学习

摘要

大语言模型 (LLM) 在线强化学习 (RL) 的最新进展在复杂推理任务中表现出了良好的性能。然而,它们经常表现出不平衡的探索-利用权衡,导致不稳定的优化和次优性能。我们引入了 IB-Score,这是一种基于信息瓶颈理论的新颖指标,它通过量化步骤级推理多样性和与正确答案共享的相互信息之间的权衡来评估策略的探索-利用平衡。基于 IB-Score 的分析表明,具有常见正则化器的流行在线 RL 方法(例如 GRPO)无法在训练过程中始终保持平衡,结果并不理想。为了解决这个问题,我们提出了信息瓶颈驱动的基于树的策略优化(IB-TPO),这是一个原则性框架,将IB-Score制定为细粒度的优化目标,并利用新颖的IB引导树采样策略,不仅在相同的词元预算下增加了50%的轨迹,提高了在线采样的效率,而且还重用了树结构以进行有效的IB-Score蒙特卡罗估计。跨标准基准的大量实验表明,我们的方法显着优于 GRPO 基线 2.9% 至 3.6%,并且也优于其他最先进的在线 RL 方法。我们的代码可在 https://github.com/alibaba/EfficientRL 获取。