论文

使用、提及还是谴责?代码混合印度英语厌女症检测中使用提及区分的受控对比集诊断

Used, Mentioned, or Condemned? A Controlled Contrast-Set Diagnostic for the Use-Mention Distinction in Code-Mixed Hinglish Misogyny Detection

模型评测基准与评测资源

摘要

词典驱动的厌女症检测器无法从结构上区分针对女性的诽谤和反言论中提到的相同诽谤(“不要这样称呼她”)——但正是这种区别决定了适度是保护还是压制讨论虐待的人。我们用代码混合的印度英语研究这个问题并做出三个贡献。首先,我们在公开可用的编辑语料库上诊断出两个评估工件:类别编码匿名占位符泄漏标签(无学习规则得分 1.000),甚至在它们被中和之后,厌女症和良性评论占据词汇不相交的寄存器,因此词袋在随机交叉验证下达到大约 1.00 的宏 F1,但在模板不相交评估下崩溃。其次,我们发布了 Hinglish-MGY-Diag,一个确定性生成器和一个跨五个语言动机类别的 416 项/163 最小对对比集诊断,其中连词的存在和性别语域通过构造与标签去相关。第三,我们引入了严格的配对一致性度量,只有当最小配对的两个成员都被正确标记时,该模型才可信。在构造不相交的五重交叉验证下评估的五个从头开始的经典基线表明,最强的模型在最干净的使用提及子集上达到了 0.93 的准确度,但只有 0.82 的一致性——它仍然错误地标记了大约五分之一的反语音对。用作作者模型上限的前沿大语言模型在所有指标上均达到 1.000,同时作为独立标签验证并确认基准是能力梯度而不是对抗墙。我们发布了所有代码、数据、生成器和用于重现每个数字的 LLM 工具。