论文
量化评分细则修改对人类自动评分者一致性的统计影响
Quantifying the Statistical Effect of Rubric Modifications on Human-Autorater Agreement
摘要
自动评分器(也称为 LLM-as-judges)越来越多地用于评估和自动内容审核。然而,对于向人类和自动评分者呈现的评分细则的修改如何影响他们的分数一致性的统计分析有限。由于标准的复杂性或主观性,要求总体或\emph{整体}判断的评分标准(例如,对论文的“质量”进行评级)可能会得到不一致的解释。相反,评分标准可以要求\emph{分析}判断,将评估标准分解——例如,“质量”为“流畅性”和“组织性”。虽然可以编辑这些评分标准以提高人工评分和自动评分的个体准确性,但这种方法可能会导致两个分数之间或相关整体判断之间出现分歧。设计和部署可靠的自动评分器不仅需要理解人类和自动评分器注释之间的关系,还需要了解这种关系如何随着整体或分析判断的引发而变化。结果表明,标题编辑提供了代表性示例和额外的背景,并减少了标题中的位置偏差,从而增加了人类与评审者的一致性,而较高的标题复杂性和保守的聚合方法往往会降低这种一致性。自动论文评分和遵循指令的评估领域的研究结果表明,从业者应该仔细分析特定领域和特定评分标准的表现,以实现更高的人类自动评分者一致性。