论文
SPS:引导概率压缩以更好地探索 大语言模型 的强化学习
SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models
摘要
强化学习(RL)已成为通过利用基于规则的奖励信号来训练面向推理的模型的有前途的范例。然而,强化学习训练通常倾向于提高单样本成功率(即 Pass@1),同时提供对不同推理轨迹的有限探索,而这对于多样本性能至关重要(即 Pass@k)。我们的初步分析表明,这种限制源于基本的挤压效应,即概率质量过度集中在高奖励轨迹的狭窄子集上,限制了真正的探索并限制了强化学习训练下可达到的性能。为了解决这个问题,在这项工作中,我们提出了转向概率压缩(SPS),这是一种将传统强化学习与逆强化学习(IRL)交织在一起的训练范例。 SPS 将 同策略采样轨迹视为演示,并使用 IRL 显式地重塑诱导轨迹分布,从而在不引入外部监督的情况下增强探索。对五个常用推理基准的实验表明,SPS 可以实现更好的探索并改进 Pass@k。除了算法贡献之外,我们还对 RL 学习动态进行了分析,并确定了 Pass@k 的经验上限,揭示了基于 RL 的推理模型的内在探索限制。我们的研究结果表明,RL 和 IRL 之间的交替提供了扩展面向推理的 大语言模型 探索能力的有效途径。