论文
将拼图放在重要的地方:强化学习的问题增强框架
Placing Puzzle Pieces Where They Matter: A Question Augmentation Framework for Reinforcement Learning
摘要
强化学习已经成为增强 大语言模型 推理的强大方法,但面临着一个根本性的困境:对简单问题的训练可能会导致过度拟合和 pass@k 退化,而对困难问题的训练往往会导致奖励稀疏。最近的问题增强方法通过预先考虑部分解决方案作为提示来解决这个问题。然而,统一的提示提供可能会引入冗余信息,同时错过关键的推理瓶颈,而过多的提示会减少推理多样性,导致 pass@k 性能下降。我们提出 \textbf{PieceHint},一个提示注入框架,可以在训练期间战略性地识别并提供关键推理步骤。通过对不同推理步骤的重要性进行评分、根据问题难度有选择地分配提示以及逐步撤回脚手架,PieceHint 使模型能够从引导学习过渡到独立推理。对六个数学推理基准的实验表明,我们的 1.5B 模型实现了与 32B 基线相当的平均性能,同时保留了所有 $k$ 值的 pass@k 多样性。