论文
可靠但设计敏感:LLM 注释中的仪器不确定性
Reliable but Design-Sensitive: Instrument Uncertainty in LLM Annotation
摘要
大语言模型 (LLM) 可以在一种设置下提供可靠的标签,但当研究人员做出其他合理的设计选择时,可以更改这些标签。我们测试了 7 个大语言模型、12 个任务设计、3 个独立运行以及 3,000 条带有攻击性语言和仇恨言论标签的推文。重复相同的模型和任务设计产生了高度一致性(Fleiss 的 $κ 中位数= 0.91$)。当我们改变相同推文的任务设计时,我们达成了一致(Cohen 的 $κ 中位数= 0.76$)。与单独的抽样方差相比,任务设计和模型选择使冒犯性语言的估计患病率方差增加了 76.7 倍,仇恨言论的估计患病率方差增加了 110.6 倍。 LLM 任务设计的差异达到 560-572 个基点,而五个人类仪器版本的差异为 270-331 个基点。置信度分数并没有解决这个问题。他们对重复模型输出的跟踪比与人类标签的一致性更密切,并且将 6 条推文分组在一个提示中使平均攻击性语言置信度降低了 660 个基点。我们将任务设计和模型选择引起的变异称为工具不确定性。研究人员只能通过比较合理的任务设计来衡量它。重复一项设置或依赖置信度分数不能取代该测试。