论文

通过渐进点匹配的长视野语言模型强化学习

Long-Horizon Language Model Reinforcement Learning via Progressive Point Matching

模型训练强化学习

摘要

当前通过强化学习训练语言模型的范例在很大程度上依赖于稀疏的结果奖励。然而,当我们追求需要更长、更复杂轨迹的任务时,这种策略会导致学习速度缓慢。先前的工作试图通过奖励部分进展来解决这个问题;然而,幼稚的表述往往存在偏见,并且趋向于次优政策。我们证明了一种简单且无偏见的密集奖励公式(我们称之为渐进点匹配),通过在理论和经验上通过合成环境奖励分段级别的部分进展,可以更有效地以指数方式扩展至长期任务。然后,我们展示了如何使用每个任务的单个参考轨迹来实际实例化渐进式点匹配。在极其困难的数学推理问题上,稀疏的结果奖励无法取得任何进展,而按成功率或 pass@k 衡量时,分段级奖励可以在更大的测试时间 词元预算 上实现改进。