论文
DIA-HARM:50 种英语方言中有害内容检测的方言差异
DIA-HARM: Dialectal Disparities in Harmful Content Detection Across 50 English Dialects
摘要
有害内容检测器,特别是虚假信息分类器,主要是在标准美式英语 (SAE) 上开发和评估的,其对方言变化的鲁棒性尚未得到探索。我们推出了 DIA-HARM,这是第一个评估跨美国、英国、非洲、加勒比和亚太地区 50 种英语方言的虚假信息检测鲁棒性的基准。使用 Multi-VALUE 的语言基础转换,我们引入了 D-CUBE(方言虚假信息检测语料库),它是 DIA-HARM 的核心语料库组件,包含源自已建立的虚假信息基准的 195K 个样本。我们对 16 个检测模型的评估揭示了系统漏洞:人工编写的方言内容使检测性能降低了 1.4-3.6% F1,而人工智能生成的内容保持稳定。经过微调的 Transformer 的性能大大优于零样本 LLM(96.6% vs. 最佳情况 F1 的 78.3%),其中一些模型表现出灾难性故障,混合内容的退化超过 33%。跨 2,450 个方言对的跨方言迁移分析表明,多语言模型(mDeBERTa:平均 F1 为 97.2%)可以有效泛化,而 RoBERTa 和 XLM-RoBERTa 等单语言模型在方言输入上失败。这些发现表明,当前的虚假信息检测器可能会系统性地使全球数亿非 SAE 发言者处于不利地位。我们发布了DIA-HARM基准测试,包括D-CUBE语料库(https://github.com/jsl5710/dia-harm)和评估工具(https://jsl5710.github.io/dia-harm)。