论文
LLM 作为法官评估的一致性指标:报告内容和原因
Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why
摘要
基于评分标准的 LLM 判断是否可以替代人工注释取决于其与人工标签的测量一致性。然而,相同的判决可以支持截然不同的协议数量,具体取决于看似次要的选择:判决规模、保留的案例、弃权和无效输出的处理以及跨项目和标题标准的判决汇总。解决这些选择的统计数据已经建立,但是是在心理计量学、计量经济学和语料库注释中建立的,而不是在需要它们的评估实践中建立的。我们将这些选择视为一种测量协议,该协议在计算任何指标之前修复报告的数字估计值,将相关结果组装成单个源归因分析,并将其应用于三个已发布的 LLM 法官评估。对于非简并二元判决,Pearson 的 $r$、Spearman 的 $ρ$、Kendall 的 $τ_b$、phi 系数和 Matthews 相关系数是完全相同的统计量,因此以不同的名称报告多个重复的数字。 Cohen 的 $κ$ 与它们的不同之处仅在于 $(0,1]$ 中的边际不匹配因子,并且当法官和人类同样频繁地分配肯定判决时,它们的渐近方差相同。在排除情况下,所有情况的准确性仅被限制在与未覆盖分数一样宽的最坏情况区间。在带有每个标准人类标签的标题基准上,仅协议选择就将报告的准确性从 $0.551$ 移动到 $0.899$,并在整个范围内携带 $κ$零,而不改变任何一个结论。我们将分析提炼成一份报告清单,使协议声明可重构和可比较。