论文
评判评判者:将Rasch测量理论用于大语言模型评估
Rating the Raters: Rasch Measurement Theory for LLM Evaluation
摘要
LLM现在参与评估的各个方面:作为考生在基准上的得分、其他模型输出的评判者以及人类生成内容的评分者。每个范式都可以被视为一个测量问题,其中法官或评估者使用仪器(例如基准)中的项目来探测对象的潜在属性。标准评估实践常常忽略每个核心组成部分对最终结果的贡献,限制了我们对所测量内容的理解。拉希测量理论(RMT)非常适合解决这个问题。 RMT 将顺序评级分解为通用尺度上的可分离的方面。它还提供了一系列诊断功能,可以识别错误校准的测量结果和评估者偏差。我们使用测量仇恨言论语料库提出了将 RMT 应用于LLM作为评估者范式的案例研究,其构造本身是在 RMT 下构建的。我们将一系列多方面的 Rasch 模型与跨越家庭和能力级别的九个LLM的注释进行拟合。我们的分析表明,LLM在严重性、项目级校准、问题顺序稳健性、目标身份敏感性和评级量表使用方面与人类评估者存在系统性差异,所有这些标准评估实践都会在很大程度上掩盖。总的来说,我们认为 RMT 属于评估 LLM 考生、法官和评估者范式的工具包。
