论文

LLM评委的超越分数对齐心理测量分析

Evaluating LLM-as-a-Judge Beyond Score Alignment: A Psychometric Analysis of Residual Judging Difficulty

模型评测评测方法与指标

摘要

大语言模型广泛用作自动裁判,其效度通常通过与人类分数的对齐评估。但聚合一致无法揭示人类与LLM是否觉得相同的评估案例困难。本文以心理测量视角在摘要评估中研究该问题:分别对人类与LLM评分拟合多面Rasch模型,把分数分解为潜在摘要质量、评分者严厉度、维度严重度与评分量表阈值。基于该分解,我们定义残余难度——模型调整后的评判难度度量——并比较人类与LLM裁判是否共享相同的难度结构。SummEval上17个开放权重LLM裁判的分析显示:潜在摘要质量的中等对齐并不意味着残余难度的对齐;人类与LLM裁判在哪些摘要-维度单元仍然困难上存在分歧,且这种错配强烈依赖维度。一致性呈现显著的LLM难移位,而连贯性呈现人类难移位。我们进一步显示人类易而LLM难的案例可部分从可观察的源-摘要属性预测。这些发现表明聚合人类对齐只反映LLM-as-judge可靠性的一部分,而心理测量残余诊断支持更有信息量的评委评估与更有针对性的人机协作。