入口被锁,内部开放:RLVR 缩小解决方案空间
Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space
摘要
具有可验证奖励的强化学习 (RLVR) 极大地提高了单样本准确性 (pass@1),但会导致策略的解决方案空间收缩,从而减少测试时间扩展的回报。在这项工作中,我们研究了推理轨迹内的广度在何处丢失:策略是否无法访问有效的解决方案系列,或者一旦启动就无法执行计算?为了将访问与执行分离,我们分析了 Countdown 任务,其解决方案空间可以详尽地枚举到由第一个操作数和运算符定义的离散入口族中,跨越 Qwen2.5-3B 上的 PPO 和 Qwen2.5-3B-Instruct 上的 GRPO。在这两种训练设置中,解决方案覆盖率下降了高达 67%,甚至在所有检查点解决的问题上也下降了一半。我们表明,这种收缩主要集中在入口处:在第一次算术运算之前,每个标记的似然变化比下游推理期间大 11 倍--16 倍。仅提供未选择的入口前缀可将低访问家庭的完成率恢复一个数量级以上(PPO 下为 0.018 -> 0.212),这表明替代解决方案仍然可执行,但不再启动。在这种定位的指导下,我们发现虽然表面提示无法恢复多样性,但以入口为目标的干预却成功了:带有早期检查点的后层参数插值将解决方案覆盖率提高了 37%,并且在 pass@1 中没有损失。最后,我们表明,早期步骤熵崩溃在 7B 和 14B 模型的六个数学基准中重复出现,但这并不是推理优化不可避免的副产品:SFT 基线保留了两倍以上的覆盖范围,并且分阶段的 SFT--DPO--RLVR 管道保留了早期步骤熵。总而言之,推理广度是在门口丧失的,而不是在房间内丧失的。代码:https://github.com/ershiyidian/early-branch-locking。