论文
从判断质量到下游效用:重新思考大语言模型作为评审的开放式任务
From Judgment Quality to Downstream Utility: Rethinking LLM-as-a-Judge for Open-Ended Tasks
摘要
评审大语言模型越来越多地用于评估对缺乏真实答案的开放式任务的政策反应。现有的工作往往直接将由此产生的判断转化为政策训练的奖励信号,对内在判断质量的关注有限,并且很大程度上限制了评审对训练时监督的使用。我们通过检查如何得出判断以及如何使用判断来系统地研究判断质量和下游效用。对于判断启发,我们在三个维度上改变 Judge 协议:判断粒度、批评使用和评估批处理。对于判断的使用,除了策略训练之外,我们还通过 Best-of-N 选择、Judge 引导的修订和集束搜索将 Judge 扩展到测试时推理。我们发现,(i)令人惊讶的是,判断质量和下游效用并不总是一致。 (ii) 判断协议设计极大地影响内在判断质量和下游效用。 (iii) 评审指导有效地将测试时计算转化为性能增益,其好处因推理策略而异。我们的结果要求对大语言模型评审对开放式任务进行多方面的评估,包括内在的判断质量和下游效用。