论文
MultiSoc-4D:孟加拉社交媒体封闭集中指令引起的标签塌陷诊断基准 LLM 注释
MultiSoc-4D: A Benchmark for Diagnosing Instruction-Induced Label Collapse in Closed-Set LLM Annotation of Bengali Social Media
摘要
通过 大语言模型 (LLM) 实现注释自动化是扩展 NLP 数据集的核心方法;然而,LLM 对于低资源语言中闭集指令的行为尚未得到充分研究。我们提出了 MultiSoc-4D,这是一个孟加拉社交媒体数据集基准,其中包含来自六个来源的 58K+ 社交媒体评论,并按四个维度进行注释:类别、情绪、仇恨言论和讽刺。通过采用结构化管道,其中 ChatGPT、Gemini、Claude 和 Grok 分别注释单独的分区,同时共享 20% 的通用验证集,我们系统地诊断 LLM 行为。我们发现了一种普遍存在的现象,称为“指令引起的标签崩溃”,其中 LLM 显示出对后备标签(其他、中性、否)的系统偏好,导致较高的一致性率,但少数类别的检测不足。例如,我们发现与人工校准的参考相比,LLM 未能检测到 79% 和 75% 的具有仇恨和讽刺内容的实例。此外,我们证明它代表了一种“标签一致性错觉”,通过讽刺检测上几乎为零的 Fleiss Kappa ($κ\approx -0.001$) 进行统计验证。在 40 多个 LLM 中,我们在训练管道中对这种注释偏差传播进行了基准测试,无论架构差异如何。我们发布了 MultiSoc-4D 作为孟加拉语 NLP 注释偏差的诊断基准。