论文
生成和完善 LLM-as-a-Judge 的动态评估量规
Generating and Refining Dynamic Evaluation Rubrics for LLM-as-a-Judge
摘要
LLM-as-a-Judge 是人类评估的可扩展替代方案,但现有的基于评分标准的方法依赖于人工注释的数据,例如参考答案或专家制作的评分标准。我们建议自动生成细粒度的评估标准,无需任何人工注释。我们的 无需训练 方法以数据集特定和实例特定的粒度生成评分细则,在四个基准测试中实现与现有方法竞争的性能。我们进一步提出了一种通过元判断奖励信号迭代微调标题生成器模型的方法。经过微调的生成器在成对和逐点评估方面均优于所有现有基线。值得注意的是,经过微调的 14B rubric 生成器在 rubric 生成方面优于更大的专有模型,这显示了我们 微调 策略的有效性。