论文

GRPO组内验证器错误是否独立:来自Qwen2.5采样轨迹的证据

Are Verifier Errors Independent Within a GRPO Group? Evidence from Qwen2.5 Rollouts

模型评测鲁棒性、公平性与可信度评测

摘要

具有可验证奖励的基于组的强化学习 (RLVR) 使用自动验证器在每次提示时获得多个完成分数。基于独立验证者错误的分析可能会忽略与共享答案格式相关的依赖性。我们在 Qwen2.5-1.5B 在 MATH、GSM8K 和 DeepMath-103K 上生成的 24,998 组八个补全中研究了这种依赖性。我们估计组内验证者的汇总误差相关性为 0.530(95% 置信区间:0.500--0.560)。在可交换误差模型下,这对应于八个完成组的设计效果调整有效样本量为 1.70。不同答案形式的依赖性差异很大:分数、部首、符号表达式和间隔比单位注释和百分号表现出更强的聚类性。在四种基于规则的验证器配置中重放组相对优势,可识别出高达 0.83% 的组中至少有一个优势标志不一致。因为一组对一个提示重复采样,所以这种组内聚类可能反映了共享的提示难度以及共享的答案形式,我们不试图在这里将两者分开。与多个评估者之间的相关判断的研究不同,我们的分析检查了同一验证者评分的完成之间的依赖性。这些发现激发了对验证者噪声进行提示和答案形式感知的分析,而不是仅仅基于总体错误率进行表征。