论文

RubricEval:LLM评审指令遵循的量规级元评估基准

RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following

模型评测基准与评测资源

摘要

基于量规(rubric)的评估已成为评估大语言模型(LLM)指令遵循能力的主流范式。尽管应用广泛,这类量规级评估的可靠性仍不明确,亟需元评估。然而,已有的元评估工作大多聚焦于回复层面,未能评估基于量规的评估所依赖的细粒度判断准确性。为弥合这一差距,我们提出RubricEval。我们的基准具有以下特点:(1) 首个面向指令遵循的量规级元评估基准;(2) 涵盖多个类别和模型来源的多样化指令与回复;(3) 规模达3,486个经过质量控制的实例,并配有能更好区分评审性能的Easy/Hard子集。实验揭示量规级评判远未解决:即使是在指令遵循基准中被广泛采用的评审GPT-4o,在Hard子集上也仅取得55.97%的成绩。就评估范式而言,量规级评估优于检查单级评估;显式推理能提升准确性;二者结合可降低评审间差异。借助我们建立的量规分类体系,我们进一步识别出常见的失败模式,为可靠的指令遵循评估提供了可操作的洞见。

RubricEval:LLM评审指令遵循的量规级元评估基准:论文配图
图1:对比现有基于量规的指令遵循评测与本文提出的量规级元评测任务。