论文
大语言模型意见不一致的地方专家崛起:利用跨模型分歧来针对大规模注释的大语言模型密码本修订中的专家努力
Experts Rise Where LLMs Disagree: Using Cross-Model Disagreement to Target Expert Effort in LLM Codebook Revision for Large-Scale Annotation
摘要
大规模文本注释通常通过人工智能注释者遵循的密码本为数百万份文档带来专家见解。然而,开发一个强大的密码本需要几个月的时间。大型语言模型 (LLM) 可以通过将早期的密码本应用于数据、呈现具有强烈 LLM 分歧的案例并征求专家反馈来解决这些问题,从而加快这一过程。我们研究了专家为LLM密码本修订提供反馈的三种方式:(i)编辑由跨LLM分歧驱动的LLM生成的修订(密码本验证),(ii)回答有关LLM分歧的问题(问答),以及(iii)用理由标记分歧案例(理由标签)。对数千份辅导课程成绩单进行的实验表明,相对于专家标签,Rationale Labeling 产生了最高的 LLM 标记准确率 (64.9%),优于专家修订的密码本 (57.8%)。最佳问答设置也优于它(60.5%)。我们的工作表明,大语言模型可用于战略性地瞄准专家的注意力,将数月的密码本修订时间缩短为数天,而不会牺牲标签性能。