当奖励套件泄漏时:RLVR 中自然验证者误报的预先注册因果对比
When the Reward Suite Is Leaky: A Preregistered Causal Contrast of Natural Verifier False Positives in RLVR
摘要
用作代码 RLVR 奖励的测试套件具有天然的误报:每个任务的持续性非对称错误,每次出现时都会接受相同的错误程序,这与现有噪声鲁棒性分析假设的对称或重新采样噪声不同。我们在已部署的套件上运行预先注册的双臂因果对比:在相同的 MBPP 任务、种子和计算上进行 GRPO,通过原始 MBPP 测试(泄漏)与 MBPP+ 额外测试(强化)进行奖励。另外两个家族在其数据存在之前就在冻结的预注册下复制了该设计。 [C] 平均保留效应是有界的:在预先注册的 1.5分非劣效界值(差距 0.20 分,单边 95% 上限 0.75 分)下,达到非劣效标准。 [C] 奖励假阳性质量跟踪训练前计算的廉价静态泄漏审计(Spearman 0.80),并且注册的列车端测试使泄漏层 FP 份额比清洁任务高出 +43.8 pt。 [E] 根据已签名的、人工裁决的规则审核每个奖励的 FP,发现大量残留的经过验证的真正错误代码:记录加权的 47.57%;两个复制家族都复制了很大一部分。奖励是针对真正的错误而不仅仅是套件工件。 [E] 机制证据与选择预先存在的错误模式而不是学习利用是一致的:FP 发生率不会在我们的范围内增长,并且未经训练的基础模型已经在泄漏过滤器下产生相同的错误输出。然后,我们将同样的工具转向前沿法官本身:根据他们自己的误报,他们的自我评估很弱,同一作者的测试尚未解决,甚至我们调查的得分最高的读者在较弱的政策错误上的得分也远远低于其分数——MBPP 上的两个主题,总体上对前沿模型没有任何许可。廉价的静态审核可在预训练定位暴露情况;强化奖励可以消除测量膨胀,尽管在这里它买不到什么能力。