论文

评判评判者:将Rasch测量理论用于大语言模型评估

Rating the Raters: Rasch Measurement Theory for LLM Evaluation

模型评测评测方法与指标

摘要

LLM现在参与评估的各个方面:作为考生在基准上的得分、其他模型输出的评判者以及人类生成内容的评分者。每个范式都可以被视为一个测量问题,其中法官或评估者使用仪器(例如基准)中的项目来探测对象的潜在属性。标准评估实践常常忽略每个核心组成部分对最终结果的贡献,限制了我们对所测量内容的理解。拉希测量理论(RMT)非常适合解决这个问题。 RMT 将顺序评级分解为通用尺度上的可分离的方面。它还提供了一系列诊断功能,可以识别错误校准的测量结果和评估者偏差。我们使用测量仇恨言论语料库提出了将 RMT 应用于LLM作为评估者范式的案例研究,其构造本身是在 RMT 下构建的。我们将一系列多方面的 Rasch 模型与跨越家庭和能力级别的九个LLM的注释进行拟合。我们的分析表明,LLM在严重性、项目级校准、问题顺序稳健性、目标身份敏感性和评级量表使用方面与人类评估者存在系统性差异,所有这些标准评估实践都会在很大程度上掩盖。总的来说,我们认为 RMT 属于评估 LLM 考生、法官和评估者范式的工具包。

评判评判者:将Rasch测量理论用于大语言模型评估:论文配图
图4:评估对大语言模型定标器进行项目校准的可靠性。热马普显示从等式4获得的二(yy-轴)和大语言模型速率jj(xx-轴)的个别互动术语。大语言模型按严重程度的不断上升的顺序从左到右分类(见图3)。颜色表示 lij\muij} 的大小和符号: 红色表示大语言模型比预期的要小( 更容易标记); 黑色表示比预期的要严重。标记表示对 mij=0\muij0 的 Wald t-t试验 (*:p < 0.1*: p<0.1; :p < 0.05**:p < 0.05; :p < 10_ 3***:p < 10}-3})。