论文

LEEPS:大语言模型 中的潜在引导探索利用提示采样以实现高效 RLVR

LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models

模型训练合成数据

摘要

具有可验证奖励的强化学习(RLVR)提高了大语言模型的推理能力,但具有相同轨迹采样奖励的提示组在没有有效学习信号的情况下消耗了生成预算。采样前提示选择可以通过在轨迹采样生成之前筛选提示来减少这种浪费。然而,现有的采样前方法很难平衡利用和探索:重复利用历史信息提示可能会缩小训练覆盖范围,而更广泛的探索可能会降低信息提示的比例。为了解决这些限制,我们引入了 LEEPS,一种潜在引导探索——利用提示采样器,它自适应地平衡先前观察到的信息提示的重用与对不确定提示的持续探索。 LEEPS 将候选者划分为利用和探索组合,并根据其最近的重要比率自适应地分配轨迹采样预算。它进一步使用表示空间邻居和历史轨迹采样结果来优先考虑可能产生非零奖励方差的不确定提示,从而使探索更有针对性,而无需额外的轨迹采样。在六个数学推理基准测试中,LEEPS 在两个模型尺度上均取得了最高的平均得分,相对于 Qwen2.5-Math-1.5B 和 7B 的最强基线分别提高了 2.6% 和 3.7%,并且在训练过程中通常提高得更快。它还在两个模型规模的三个评估的 OOD 一般推理基准中获得了最高的平均分数,并且每个训练步骤仅增加了约 2 秒的在线采样开销。代码可在 https://github.com/ShuangLiangX/LEEPS 获取。