论文
验证者失败的地方:RLVR 中奖励信号的类别级审核
Where the Verifier Fails: A Category-Level Audit of Reward Signals in RLVR
摘要
具有可验证奖励的强化学习 (RLVR) 和标准基准评估都依赖于自动验证器,将自由文本答案转换为二进制奖励。之前的工作报告称,一个评估工具仅接受其自身 真值 答案的约 94%,这归咎于 LaTeX 解析。这是一个汇总:它没有说明哪些答案表格消耗了错误预算。我们提供分解。我们将变质测试应用于验证者而不是模型,生成经过认证的等效答案变体,即通过构造保留数学含义的重写,因此任何拒绝都是可证明的假阴性,无需人工裁决。然后,我们测量了四个广泛使用的验证器超过 307,420 个判决中每个答案类别的拒绝情况。我们发现三件事。 (1) 对于相同的输入,自我验证范围从 53.8% 到 95.2%,相差 41.3 个百分点。发布的图描述的是一种实现,而不是任务;同一文库的两种配置在 49.9% 的配对上不一致。 (2) 残差并未分布在解析类别中,而是集中在空格和标点符号上,这占默认 LaTeX 配置的合约失败的 93.0%。尾随句点或换行符在预算中占主导地位。 (3) 将拒绝与执行失败分开表明,具有类似聚合错误的验证者会因相反的原因而失败,并且参考数字级联接受一个错误答案作为幅度的阶跃函数,从低于 10^4 的 0% 到等于或高于 100%,因为其相对容差是尺度不变的。