论文
幽灵注释器:通过保形预测探索内容审核中人类标签变化的框架
The Ghost Annotator: a Framework to Explore Human Label Variation in Content Moderation through Conformal Prediction
摘要
目前的研究主要集中在模型性能上,而对不确定性估计的关注相对较少,特别是在 LLM 越来越多地用于生成带注释数据的环境中。我们引入了一个将共形预测与协作过滤式注释者表示相结合的框架,以对与人类注释者相关的 LLM 行为进行建模,并分析同意和分歧的模式。使用不合格分数,我们引入了 Ghost Prediction 指标和 Ghost Annotator 表示来量化模型预测与所有可用的人类注释不一致的情况。我们计算余弦相似性度量来探索跨社会人口统计轴的模型行为的差异。我们评估了四个内容审核数据集中不同大小和系列的四个 LLM。我们的研究结果表明,虽然我们发现所有模型的不确定性都会随着注释者的分歧而增加,但较大的模型往往对与任何人类注释不一致的文本进行分类更有信心。最后,幽灵注释器框架揭示了人口统计失调的一致且稳健的模式,表明结构性偏差可能源于预训练语料库。