论文

JudgementBench:比较质量评估的评分标准和偏好评估

JudgmentBench: Comparing Rubric and Preference Evaluation for Quality Assessment

模型评测基准与评测资源

摘要

两种方法主导了当前的基准测试实践:基于量规的评分根据预定义的标准评估项目,而比较判断则引发输出之间的成对偏好。尽管这两种方法都被广泛使用,但它们之间的选择很少是合理的。我们发布了 JudgmentBench,这是 30 项现实世界法律任务的基准,搭配从具有丰富经验的执业律师(包括美国主要律师事务所)收集的 1,539 个评分表和 1,530 个成对偏好判断。这些注释构成了高专业领域中第一个公开可用的数据集,其中两个监督信号都是从相同项目的相同专家处引出的。使用 LLM 在三个构建的质量水平上生成的输出,我们提供了初步的实证比较:在每个任务排名相关指标(平均 Spearman 排名相关性为 0.908 与 0.150,估计差异 = 0.758 [0.494, 1.021])和每个判断成对胜率下,比较判断比评分标准更好地恢复了预期的质量排序指标(0.669 vs. 0.542,估计差异 = 0.127 [0.067, 0.186]),同时需要不到一半的注释时间。这些模式适用于人类注释者和 LLM 自动评分者。除了初步比较之外,数据集的配对结构还支持更广泛的研究议程,即如何在没有可验证的 真值 的情况下引出、汇总专家判断并将其用作领域中的监督。