论文
当 RLVR 缩小推理边界时:诊断 Pass@k 反转
When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion
摘要
具有可验证奖励的强化学习(RLVR)可以提高单样本准确性,同时使模型在重复采样下变得更糟。我们研究了这种 pass@k 反转:训练后,该策略在 $k$ 范围内解决的明显问题可能比其基本模型要少。失败集中在边界提示上,其中基本模型包含罕见的正确轨迹,这些轨迹可以通过采样恢复,但过于稀疏,无法可靠地出现在有限的 RLVR rollout 组中。我们认为,两种模式的解释将其解释为缺乏证据的失败:罕见的正确轨迹可能会在 RLVR 采样之前消失,并且经常会强化它们。主要贡献是这种诊断和机制框架。每个问题的碱基锚定 (PBA) 是一种特意简单的概念验证:用足够的冻结碱基正确证据来锐化提示,并将有风险的提示锚定到碱基分布。在 Omni-MATH-Test 上的三个训练种子中,以 MATH500 作为辅助高覆盖率验证基准,PBA 相对于匹配的 GRPO 提高了 \PassK{1} 和高预算覆盖率。一项 3000 提示机制控制的诊断研究在种子之间与预期特征一致:普通 GRPO 失去了碱可解边界提示,而 PBA 保留了罕见的验证者阳性轨迹。我们使用数学验证器作为验证器引导优化的受控测试平台;当外部工具或验证者检查重复的视觉、空间或图表推理尝试时,相同的 pass@k 反转风险适用于 ECCV 相关的视觉语言代理。推理 后训练 不仅应该决定优化的强度,还应该决定优化哪些提示是安全的。