论文

经典测试理论误导大语言模型法官的三种方式

Three Ways Classical Test Theory Misleads for LLM Judges

模型评测评测方法与指标

摘要

大语言模型法官根据一个评分标准对一系列回答进行评分,可靠性为 0.52 美元。测量了什么?法官评估已经开始借鉴经典测试理论中的可靠性统计数据,通常不会说明每个统计数据假设的测量设计,并且我们表明,三个广泛可移植的统计数据对于法官和测试来说意味着不同的东西,因为法官设置重新安排了这些设计所依赖的角色。首先,根据评分标准元素计算的内部一致性系数不包含评分器方面。假设一名评委的测量错误率固定为 $4.72\%$,KR-20 的范围仍为 $0.01$ 到 $0.68$,因为题库围绕它重新设计,并且不同的评委误差使系数移动了可比较的量,因此项目设计和评委误差不会单独识别,并且没有单个值可以被解读为评委的属性。其次,可靠性指数 $\Phi(\lambda)$ 是方差分量的比率,有时识别它的分类概率在我们银行上与它相差 $0.25$-$0.43$,在基础模型完全成立的模拟数据上相差 $0.17$-$0.30$。第三,利文斯顿-刘易斯准确性与考生自己在同一乐器上的真实分数挂钩,因此根据外部黄金进行评分将判断的不可靠性与标准的无效性混为一谈。回顾了三篇最接近的法官评估论文,我们没有发现这些错误的公开实例,这使得我们保持谨慎的态度。尽管如此,一个不能归因于法官的系数仍然会进入下游部署决策和披露文件。因此,我们以四个报告线结束,这些报告线将归属信息附加到号码上。