论文
在不可验证的LLM后训练中检验推理型LLM裁判
Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
摘要
推理型LLM裁判(LLMs-as-Judges)能够受益于推理时扩展,为把推理模型的成功延伸到输出正确性/质量无法直接检验的不可验证领域提供了有前景的路径。然而,尽管推理型裁判在静态评测基准上表现更佳,其在实际策略训练中的有效性尚未被系统检验。因此,我们开展一项严格研究,考察非推理型与推理型裁判在基于强化学习的LLM对齐中的实际影响。在受控合成设置中,由“金标准”裁判(gpt-oss-120b)提供偏好标注以训练更小的裁判,揭示了非推理型与推理型裁判的关键差异:非推理型裁判容易导致奖励劫持(reward hacking),而推理型裁判能训练出在金标准裁判评估下表现强劲的策略。有趣的是,我们发现推理型裁判训练出的策略之所以表现强劲,是因为学会了生成高度有效的对抗性输出,通过欺骗其他LLM裁判在Arena-Hard等流行基准上也能获得高分。结合进一步分析,我们的研究既凸显了重要发现,也指出了在不可验证LLM后训练中应用(推理型)LLM裁判的改进空间。