论文

经项目反应理论诊断LLM-as-a-Judge的可靠性

Diagnosing the Reliability of LLM-as-a-Judge via Item Response Theory

模型评测评测方法与指标

摘要

虽然LLM-as-a-Judge被广泛用于自动化评估,现有验证实践主要在观测输出层面运作,对LLM评审者自身是否作为稳定可靠的测量工具运作提供的洞见有限。为解决这一局限,我们引入一个以项目反应理论(IRT)为基础、评估LLM-as-a-Judge可靠性的两阶段诊断框架。该框架采用IRT的等级反应模型(GRM),沿两个互补维度形式化可靠性:(1)内在一致性,即测量行为在提示变化下的稳定性;(2)人类对齐,捕捉与人类质量评估的对应关系。我们用该框架实证检验多样的LLM评审者,并表明利用IRT-GRM可产生可解释的信号,用于系统性地诊断判断。这些信号为验证LLM-as-a-Judge可靠性并识别不可靠性的潜在原因提供实用指导。