论文
通过价值引导的信息搜索提高数学推理
Improving Math Reasoning through Value-guided Informative Search
摘要
具有可验证奖励的强化学习(RLVR)极大地提高了大语言模型的数学推理能力。最近的工作将搜索引入 RLVR rollout中以增加轨迹多样性,但仅多样性并不能确保搜索引发的rollout策略能够改进当前策略。为了解决这一差距,我们提出了 APIVIS,这是一种训练时间框架,可将有限预算 Gumbel 搜索适应块级数学推理。 APIVIS 将每个rollout组内的直接响应和搜索响应相结合,允许通过搜索发现的改进产生信息丰富的相对奖励。它进一步对搜索改进的词元应用选择性监督,在统一的群体奖励导致 GRPO 无效时保留学习信号。我们表明,精确的价值引导选择提高了每个搜索状态下的预期验证者奖励,并且这种保证扩展到完整的rollout策略,并在有界价值估计误差下具有相应的近似保证。在广泛认可的数学推理基准和不同模型尺度上进行的实验表明,与基于竞争性搜索的方法相比,APIVIS 有了显着的改进,验证了 APIVIS 的有效性。