论文

RLVR 是一个内核,而不是一个函数:pass@$k$ 交叉的统计推断

RLVR is a Kernel, Not a Function: Statistical Inference for pass@$k$ Crossovers

模型评测评测方法与指标

摘要

具有可验证奖励的强化学习 (RLVR) 通常会提高 pass@1,但在较大的采样预算 $k$ 下落后于其基本模型,这种交叉解读为 RLVR 只会增强现有能力的证据。我们确定了这种解读的两个限制。首先,不需要在统计上建立可见的交叉:比较相同提示的模型,我们在采样预算 $k$ 上建立置信带,需要早期增益和后期损失的证据。在五个公共 RLVR 对中,在初始评估中没有统计上建立交叉,而对新提示的 32k 词元评估发现逆转,第一次损失在 11 到 61 个样本之间;功率分析说明了为什么未能检测到交叉点并不一定意味着没有交叉点,以及为什么更多的提示比每个提示提供更多的答案更有帮助。其次,基础成功率本身并不能决定 RLVR 对提示的作用:具有相同基础成功率的提示具有不同的 RL 后成功率,并且这些差异在独立的半代中重复出现。该关系是一个条件分布(马尔可夫核),而不是一条曲线,对其进行拟合可以预测相同提示的独立代中的交叉,并纠正简单模型的功效估计。理论进一步表明,即使训练改善了其他提示,少数最难提示的损失也可能会推翻早期的领先优势,从而将存在交叉的证据与关于其对能力意味着什么的说法分开。