从基础部署到强化学习推理:预算搜索视角
From Base Rollouts to RL Reasoning: A Budgeted Search Perspective
摘要
具有可验证奖励的强化学习(RLVR)改善了语言模型推理,但这些收益与推理时间解码和搜索之间的关系仍不清楚。强化学习是否会创建基本模型所缺乏的推理,或者将采样轨迹分布转向它已经可以达到但很少采样的轨迹?我们使用统一解码框架(UDF)对此行为进行研究,该框架将 词元级 采样、类束搜索、树搜索和序列级重采样表示为共享预算操作空间上的可执行策略,并通过 pass@$k$、自洽、best-of-$N$ 和首次完成成功进行事后评分。使用来自 SimpleRL-Zoo 的成对 Base/RL 检查点,我们询问 RL 默认策略曲线是否可以通过 Base 操作点的结构化路径来近似。在 Math500、AIME、GPQA 和 IFEval 上,pass@$k$ 恢复路径遵循预算操作点转换规则 (BOPTR),$N_{\mathrm{Base}} \approx αN_{\mathrm{RL}}^β$,具有基准条件指数。在 Qwen2.5-7B 上,BOPTR 在我们测试的非预言机规则中给出了最低的传输错误,为 3.41 pp (95% CI [2.32, 5.53]);三种子复制给出 3.07 $\pm$ 0.39 pp。该规则扩展到四个系列的 10 个模型(在拟合后添加的检查点上为 3.28 到 4.87 pp),扩展到从未拟合的四个基准(5.03 pp 与拟合中的 4.44 pp),并且在没有目标模型的 RL 检查点(4.19 pp)或没有任何类型的 RL 监督(5.08页)。这些结果支持合格的内化搜索读数:在我们测试的方案下,大部分测量的 RL 增益对应于采样效率向基本模型在搜索下已经可以达到的操作点的变化。我们将缩放模式视为对此配方和队列的描述,报告它们崩溃的位置,并使用 UDF 和 BOPTR 作为行为诊断,而不是参数级别等效性的证据。