论文

JEV 与 LLM 作为评判标准:更便宜、更快,但在相同的地方却是错误的

JEV vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places

模型评测鲁棒性、公平性与可信度评测

摘要

我们询问 Jev(一种类型化分类器,可以在不生成文本的情况下返回允许答案的概率)是否可以取代 LLM 评分标准法官。我们将其与来自七个基准的九个小组的三名顶级大语言模型法官进行比较,为每位法官提供相同的标准文本。在 27 项配对比较中,只有 8 项 Jev 的准确性与 LLM 法官的准确性存在显着差异,主要在二元标准上领先,仅在分级标准上落后,而大多数其他比较都没有结论。大语言模型评委对九个小组进行了总结,每个标准召集一次,其费用是 Jev 的 29 至 325 倍,时间是 Jev 的 30 至 220 倍。在评分标准上,所有四位评委彼此之间的认同程度高于标签的认同程度,并且大多数评分都低于评分者。几个观察性的说明之一是,评估者遵循我们的标准文本省略的量表惯例。 Jev 的信心在大多数面板上对自己的错误进行了排名,这应该使廉价的分类器成为级联的理想第一阶段,将其不确定的判决推迟给 LLM 法官。相关错误消除了这一优势。 LLM 法官几乎重复了 Jev 最自信的所有错误,因此对记录的判决进行级联重播可以降低成本,但在交叉拟合阈值的情况下,最多比最佳单个法官获得 1.5 分,即使在 Oracle 阈值下,也最多获得 2.0 分。