论文
更有说服力,而不是更正确:无参考 LLM 评委的自打 奖励作弊
More Convincing, Not More Correct: Self-Play Reward Hacking of Reference-Free LLM Judges
摘要
根据语言模型自身的无参考判断(自我奖励、自我对弈和 LLM 作为法官管道的前提)来训练语言模型,假设模型对所显示答案的判断是正确的。我们证明它在结构上失败了:以候选人为条件,法官对合理性而不是正确性进行评分,从而留下政策学习利用的假阳性盆地。我们通过隐藏锚点审计来衡量这一点:法官从未看到过的、跨源的精确匹配检查。在采用 Qwen3 策略的 GSM8K 上,自我对弈将法官的通过率从 0.72 提高到 0.94,而真实准确率保持在 0.20(三颗种子)。这个 奖励作弊 不是白盒游戏:错误会在法官家族(Qwen、Llama、Gemma)和尺度之间转移,严格的三名法官组合仍然接受其中的 55%,并且没有合理性评分防御会关闭盆地。决定性的变量是法官是否在使用候选者之前提交自己的答案:首先提交将误报率从 0.719 降低到 0.012,盲解将歧视率提升到 0.96,并用作训练奖励,脱锚通道将误报保持在零,防止盆地而不是仅仅检测它。可证伪的界限(差距最多为 1 - 准确度)可以预测哪些政权会被暴露。完整的弧线无需在代码和竞赛数学的 N 最佳选择下以及 Gemma 策略下进行训练即可复制。