论文
诊断LLM评审可靠性:共形预测集与传递性违背
Diagnosing LLM Judge Reliability: Conformal Prediction Sets and Transitivity Violations
摘要
LLM-as-judge 框架越来越多地用于自动 NLG 评估,但其逐实例的可靠性仍缺乏充分理解。我们提出一套应用于 SummEval 的双管齐下的诊断工具箱:(1)传递性分析,揭示被较低的总体违背率(ρ̄ = 0.8-4.1%)所掩盖的普遍的逐输入不一致性,33-67% 的文档至少存在一个有向 3-环;(2)针对 1-5 Likert 分数的分裂共形预测集(split conformal prediction sets),提供有理论保证的 ≥(1-α) 覆盖率,其集合宽度可作为逐实例可靠性指标(r_s = +0.576,N=1,918,p < 10^-100,跨所有评审模型汇总)。关键的是,预测集宽度呈现出一致的跨评审模型一致性(r̄ = 0.32-0.38),表明它捕捉的是文档层面的难度,而非评审模型特有的噪声。在四个评审模型与四项准则上,两种诊断殊途同归:准则比评审模型更重要,其中 relevance(相关性)判定最可靠(平均集合大小 ≈ 3.0),coherence(连贯性)居中(平均集合大小 ≈ 3.9),而 fluency 与 consistency 仍不可靠(平均集合大小 ≈ 4.9)。我们发布了全部代码、提示词与缓存结果。
