论文
平均偏差:人类 忠实性 注释在本地不忠实
Averaging Bias: Human Faithfulness Annotations are not Locally Faithful
摘要
对文本摘要的 忠实性 的评估仅当模型生成的摘要的每个句子都得到源文档支持时才将其视为忠实的:严格的连接规则,在该规则下,单个不受支持的句子会使整个摘要不忠实。然而,大多数 忠实性 基准测试每个摘要仅收集一个全局人工注释标签。我们询问这样的全球人类标签是否真正实施了联合规则。我们假设,当大多数句子都忠实时,注释者可能会认为摘要是忠实的,而不仅仅是当所有句子都忠实时。为了检验我们的假设,我们在四个广泛使用的 忠实性 基准中使用五名 大语言模型 (LLM) 法官作为每个句子的评分者。我们发现,与严格连接规则的实施相比,全局人类标签与每个句子 LLM 判断的平均值的相关性更好。人工审查证实,人类标记为忠实的摘要中的很大一部分包含真正的局部事实错误。我们将这种趋势称为平均偏差。我们的结果表明,广泛使用的 忠实性 基准上的人工标签包含可测量的平均偏差,需要精心结构化的设计来实现值得信赖的人工注释