论文

时间同时性预测情感语料库中的注释质量

Temporal Simultaneity Predicts Annotation Quality in Sentiment Corpora

模型评测基准与评测资源

摘要

当活动持续数周或数月且注释池较小时,注释质量很难维持。我们提供了由三名母语注释者分八个批次注释的 3,565 条推文的 Setswana 情感数据集,并研究了注释者间一致性 (IAA) 随着时间的推移而下降的原因。尽管 Randolph 的总自由边际 Kappa 为 $κ= 0.76$(“优秀”),但在整个注释任务中,每批次 $κ$ 下降了 32 个点以上。通过六项有针对性的分析,我们发现(i)标签混淆集中在负/中性边界上,(ii)两个注释器显示与自动驾驶标签一致的游程漂移,以及(iii)$κ$的主要预测因子是时间同时性:一分钟内标记的推文达到$κ= 0.98$,而标记时间间隔超过一天的推文仅达到$κ= 0.65$。注释速度和推文级别的语言特征与 $κ$ 没有有意义的关联。我们在三类情感分类上对三种开放多语言编码器和专有模型(GPT-5 和 Gemini)进行了基准测试; 微调 比预训练基线提高了 29 到 43 个宏观 F1 点,其中 GPT-5 几次样本总体领先(62.2 宏观 F1)。我们发布数据集、每个注释时间戳和分析代码,以支持未来非洲语言 NLP 资源的可重复质量审核。