过程奖励模型的质量多样性压力测试:档案覆盖范围可以和不能证明什么
Quality-Diversity Stress Tests for Process Reward Models:What Archive Coverage Can and Cannot Certify
摘要
过程奖励模型 (PRM) 对中间推理步骤进行评分,并广泛用于搜索、排名和训练,但优化可以通过增加奖励来利用这些学习代理,同时将正确推理转变为错误推理。我们使用 MAP-Elites 将 PRM 压力测试制定为质量多样性搜索问题,在每个行为空间区域中保留最严格的正确性翻转编辑,同时将搜索覆盖范围与漏洞利用覆盖范围分开。我们描述了这些档案所证明的内容:有限细胞修复限制了覆盖细胞尾部风险和平均残留严重程度,但不能单独限制覆盖部分中最差的剩余细胞;在 Lipschitz 修复后损失和度量覆盖审核下,残差由存档拟合误差加上 Lipschitz 常数乘以覆盖半径来限制。受控环境验证了该证书以及任何仅分数最坏情况保证的不可能性。在真实的 PRM 上,搜索揭示了 Qwen2.5-Math-PRM-7B 中的一个依赖于聚合的漏洞:填充产生 44 个严格的漏洞利用,在平均池化下产生最大增益 0.294,而在最小读数下产生 1 个漏洞利用;匹配的句法控制隔离了机制,RLHFlow 值头模型显示出相同的定性效果,最大增益为 0.005。预先声明的配对 LoRA 修复协议将利用率从 0.148 降低到 0.037 到 0.074,将最严重的攻击从 0.333 降低到 0.177 到 0.212,在不降低 4 中最佳精度的情况下提高 AUROC 排名,将增益归因于对抗性 微调 而不是存档多样性,并通过独立的未配对复制(44 到1,干净分割最差增益 0.0092,MATH-500 41 比 0,干净排名 40/40)。