论文

奖励作弊 下的评估器集合:协方差几何和有限搜索保证

Evaluator Ensembles Under Reward Hacking: Covariance Geometry and Finite-Search Guarantees

模型评测评测方法与指标

摘要

语言模型法官和奖励模型可以实现可扩展的监督,但有限优化可以利用评估者错误,而不是提高响应质量。我们通过评估器集合的协方差几何来描述这种失败。对于经过校准的判断者来说,整体均值保留了全 1 方向上的共模误差,而交叉判断者的分歧仅捕获正交误差。因此,尽管有强大的聚合,但分歧可能很高,或者当共享的响应相关错误仍然存​​在时,分歧可能很低。我们证明,仅通过内部判断分数无法识别共模错误。在联合亚高斯模型下,我们限制了 best-of-K 选择夸大和目标质量遗憾,将保证扩展到条件校准下的可预测自适应搜索。生成的搜索项按 log K 的平方根缩放,并且对于高斯投影误差是渐近紧的。我们进一步证明,噪声质量代理会在不改变分歧的情况下引入人为的一阶协方差,并提出一种用于有限搜索误差和遗憾的有界二锚伯恩斯坦证书。超过 120 个(J、rho、K)配置的固定种子高斯压力测试和真实模型审核验证了该理论,同时揭示了在不断增加的搜索压力下基于分歧的诊断的局限性。