论文

LLM 和人工注释的观察等效性

Observational Equivalence of LLM and Human Annotation

模型评测模型能力评测

摘要

在本文中,我们表明大语言模型和人类编码在注释质量方面在观察上是等效的:最近的大语言模型与专家编码者的一致程度与专家本身观察到的一致程度相当。我们通过重复 14 项经过同行评审的政治科学研究的文本分类任务来证明这一点,其中 10 名大语言模型、3 名人类专家和 165 名众包工作人员使用相同的密码本对相同的文本进行独立分类。我们发现这种等价性是由文本和编码规则中的歧义驱动的。当大语言模型与专家意见不一致时,专家之间也更有可能产生不同意见,而澄清编码规则可以减少专家和能力足够强的大语言模型之间的分歧。因此,仅根据注释质量来选择人类编码几乎没有经验依据,而大语言模型在速度和成本方面具有显着优势。因此,我们认为文本注释的核心挑战不再是在人类和机器编码员之间进行选择,而是开发编码规则以最大限度地减少歧义并解释仍然存在的歧义。为此,我们建议利用大语言模型之间的分歧来识别困难案例并完善密码本,并且当无法为每个文本定义唯一注释时,我们为下游推理开发歧义感知界限。