论文

通过 RLVR 中的弱模型指导促进 LLM 探索

Boosting LLM Exploration via Weak-Model Guidance in RLVR

模型训练强化学习

摘要

带可验证奖励的强化学习 (RLVR) 显着改善了 LLM 推理,但通常会导致策略熵下降,从而导致推理覆盖范围缩小,并且对于较大的 $k$ 而言,pass@$k$ 的性能下降。虽然现有方法通过算法正则化减轻了这种熵崩溃,但跨模型非参数扰动也被忽略了。在这项工作中,我们提出了一种简单而有效的方法来在 RLVR 期间保留 LLM 的生成多样性。我们不是仅仅依靠内部探索,而是迫使目标模型根据较小、较弱的语言模型生成的部分推理轨迹来生成答案。这些不熟悉的前缀有效地打破了过度自信,并鼓励探索不同的推理路径。我们实证研究了外部前缀的潜力,揭示了分布差异对 RLVR 训练中探索动态的影响机制。多个数学基准的实验表明,我们的方法始终优于普通 RLVR。值得注意的是,随着 $k$ 的扩大,性能提升变得越来越明显,这表明推理覆盖范围显着扩大。此外,我们的方法有效地减轻了熵崩溃,而不需要额外的 SFT、复杂的奖励设计或复杂的提示。