论文
裁判应当知道什么变了:LLM即裁判评测的构念效度
A Judge Should Know What Changed:Construct Validity for LLM-as-a-Judge Evaluation
摘要
LLM即裁判的评测通常通过一致性和对表面扰动的稳健性来评估,但可靠性并不等于构念效度。我们将评估者的构念效度形式化为二维画像:不变性S,即裁决在保持构念的编辑下不变的概率;构念敏感性R,即裁决在最小构念改变编辑下改变的概率。我们证明S与R相互独立,且没有任何标量汇总能保留所有相关比较。我们在4个领域、7个裁判上,使用7种构念改变干预类型和5种仅语域对照来测量该画像,干预方向由人工标注者决定,生成、验证和评判分配给互不相交的模型家族。在匹配的不变性S ≥ 0.90下,裁判平均S = 0.945但R = 0.319。敏感性在范围编辑和强度编辑之间也不同:R_scope = 0.383对R_strength = 0.262,差距+0.121且在全部7个裁判上符号一致。我们进一步审计五个公开标注集,发现仅表面特征预测器在配对模式下可复现55%-67%的标签,包括MT-Bench人类投票的67.4%。这些结果表明,高裁判一致性可以与对被评构念变化的弱敏感性并存,因此需要联合报告不变性与敏感性,并对验证集本身进行审计。