论文

辩论帮助弱法官奖励更强的模型

Debate Helps Weak Judges Reward Stronger Models

模型评测评测方法与指标

摘要

尽管理论上有希望,但作为一种可扩展的监督协议,辩论产生了好坏参半的实证结果:在某些情况下有所收益,而在另一些情况下则无效,尤其是当法官没有隐藏信息时。我们在较强的辩论者/较弱的法官环境中研究提议者与批评者之间的辩论,涉及可程序验证的代码和逻辑任务。当批评者提供有用的优势时,辩论可以帮助法官确定咨询基线:批评者的分类能力必须超过法官,法官必须将批评者的言论视为需要验证的主张,而不是需要总结的证词。在条件成立的五对中的三对中,提议者-批评者辩论的收益在统计上比咨询显着,并且这些配对是最有能力的模型配对。在我们组中的两个无回应者配对中,辩论产生无效效应,一旦批评者进入笔录,判断验证率就会下降数十个百分点。在这些情况下,批评者的二元分类能力和法官的二元分类能力相差无几,批评者的分歧被解析为证词,而不是需要检查的主张。消除辩论中的反驳轮次不会对法官的表现产生可衡量的变化:一次独立的批评以较低的推理成本恢复了辩论的大部分好处。这些发现表明,无需训练 在可验证领域(回答、批评、判断)中的可扩展监督和部署前审计(批评者是否击败了法官,法官会验证它吗?)有一个更便宜的原语,可以预测辩论何时会有所帮助。