论文

追逐为课程,捕捉为功劳:零数据推理的追逃自我对弈 LLM 推理

The Chase Is the Curriculum, the Capture Anchors the Credit: Pursuit-Evasion Self-Play for Zero-Data LLM Reasoning

模型训练强化学习

摘要

具有可验证奖励的强化学习已成为改进 大语言模型 推理的主要方法,但它假设有大量人工管理的任务集合。零数据自我博弈消除了这种依赖性,但现有方法仅通过探测候选者并拒绝事后来审查可学习性,从不学习沿环境难度轴的何处放置任务,并仅将稀疏的终端奖励归功于求解器。我们将零数据自我对弈重新打造为一款追逐逃避游戏:在 LURE 中,LLM 逃避者沿着每个环境的难度轴定位任务,以领先规划者-执行者追捕者一步,后者通过可验证的交互来追捕它。逃避者接受了捕获前沿奖励的训练,当解算器在其采样轨迹的一半时捕获它时,该奖励达到峰值,将几乎无法捕获的目标转变为学习的定位策略,而不是手动调整的拒绝带。追赶者获得捕获锚定的密集过程信用,其中单调验证者进度与圆锚定 KL 下的终端捕获一起进行群体归一化,从而保持协同进化稳定。在三个可验证的推理环境和三个骨干系列中,LURE 的性能优于统一/专业设置下的高级基线,而统一模型比来自三个任务系列的九个保留基准中的所有经过训练的基线获得了更强的总体 OOD 零样本精度。