论文

诊断LLM评审可靠性:共形预测集与传递性违背

Diagnosing LLM Judge Reliability: Conformal Prediction Sets and Transitivity Violations

模型评测评测方法与指标

摘要

LLM-as-judge 框架越来越多地用于自动 NLG 评估,但其逐实例的可靠性仍缺乏充分理解。我们提出一套应用于 SummEval 的双管齐下的诊断工具箱:(1)传递性分析,揭示被较低的总体违背率(ρ̄ = 0.8-4.1%)所掩盖的普遍的逐输入不一致性,33-67% 的文档至少存在一个有向 3-环;(2)针对 1-5 Likert 分数的分裂共形预测集(split conformal prediction sets),提供有理论保证的 ≥(1-α) 覆盖率,其集合宽度可作为逐实例可靠性指标(r_s = +0.576,N=1,918,p < 10^-100,跨所有评审模型汇总)。关键的是,预测集宽度呈现出一致的跨评审模型一致性(r̄ = 0.32-0.38),表明它捕捉的是文档层面的难度,而非评审模型特有的噪声。在四个评审模型与四项准则上,两种诊断殊途同归:准则比评审模型更重要,其中 relevance(相关性)判定最可靠(平均集合大小 ≈ 3.0),coherence(连贯性)居中(平均集合大小 ≈ 3.9),而 fluency 与 consistency 仍不可靠(平均集合大小 ≈ 4.9)。我们发布了全部代码、提示词与缓存结果。

诊断LLM评审可靠性:共形预测集与传递性违背:论文配图
图 3:平均预测集大小为 α=0.10\alpha{=}0.10(绿色 == 小 == 可靠;红色 == 大 == 不可靠)。每个单元格显示平均集大小(较大的文本)和经验覆盖范围(较小的文本)。标准轴对变化的驱动力远远大于判断轴:连贯性和相关性(左边两列)得到了可靠的判断(≈3.0{\approx}3.0),而流畅性和一致性则接近最大不确定性(≈5.0{\approx}5.0)。所有16个小区均满足90%的覆盖保证。