论文

当 RL 抑制自己的词汇时:恢复拼图到数学迁移中的推理多样性

When RL Suppresses Its Own Vocabulary: Recovering Reasoning Diversity in Puzzle-to-Math Transfer

模型训练强化学习

摘要

使用可验证奖励 (RLVR) 的强化学习改进了 LLM 推理,但它跨域转移的条件以及为什么这样做仍然没有得到充分探索。我们在 7B 模型中研究跨域转移,该模型的 SFT 和 RL 后训练 阶段仅使用约束满足难题,后训练 数据中没有数学问题。为了分析迁移是如何出现的,我们引入了一个推理原始级框架,该框架将 9 类跨度分类器与主题提取相结合,使我们能够将思想链痕迹分割为原始主题,并跟踪它们在训练阶段和领域中的演变。我们发现谜题 SFT 引入了推理原始词汇,在 OlymMATH-Hard 上产生了 $+7$pp \texttt{pass@32} 增益。然后,Vanilla GSPO 将这些原语组成更长的计算验证链,进一步添加 $+6$pp。然而,这个强化学习阶段也抑制了探索性原语,例如 \textit{hypothesize} 和 \textit{backtrack}。为了解决这个问题,我们引入了一种新颖的奖励,以参考模型下的困惑作为信号,奖励各种正确的轨迹采样。这会在 RL 期间恢复恢复原语,并相对于普通 GSPO 进一步添加 $+7$pp \texttt{pass@32}。最后,端到端配方将 OLMo3-7B-Instruct-SFT 基础上的硬数学能力上限从 16.0\%$ 提高到 36.0\%$,而不会在 SFT 或 RL 阶段添加任何数学问题。