论文

条件准确率剖析:诊断不同部署条件下的LLM裁判

Conditional Accuracy Profiles: Diagnosing LLM Judges across Deployment Conditions

模型评测评测方法与指标鲁棒性、公平性与可信度评测

摘要

LLM作为裁判现在是可扩展评估的标准工具,但裁判的表现仍然经常用单个准确率数字来概括。该聚合视图隐藏了判断成功或失败的部署条件。我们引入了 \textbf{条件准确性分析} (CAP),这是一种事后诊断框架,它将成对的 LLM 判断准确性分解为八个条件,这些条件分为内容敏感性、稳健性和基本原理质量。 CAP 与基准无关:当基准提供所需注释时,可以直接应用它,大约通过任务子集代理,或者在可以生成扰动对时通过受控增强来应用。我们在六个成对评审基准中对七名LLM裁判实例化了 CAP,其中包括 \textsc{judgerEva-Standard},这是我们为支持所有八个条件而创建的受控测试平台。 CAP 暴露了被聚合准确率隐藏的概况差异:在 \textsc{judgerEva} 的独立于裁判的硬构建子集中,对省略资格最敏感的两位裁判在整体准确度上排名在七名裁判中的最后三名,因此省略敏感度不是通过聚合准确度来预测的。在各个基准测试中,位置鲁棒性显示出最强的排名稳定性(平均 Spearman $\barρ{=}0.87$),但在 JudgeBench-Pro 对抗压力下本身很脆弱,显示出共享条件中最大的平均准确度下降,尽管主要的降级通道因裁判而异。条件水平概况为选择LLM裁判提供了比总体准确性更具可操作性的基础。

条件准确率剖析:诊断不同部署条件下的LLM裁判:论文原图
图 1:CAP 概述。成对项目按原始顺序和交换顺序进行评估;判决和理由被映射到三组中的八个条件(内容 C1-C4、稳健性 C5-C7、理由 C8)。