论文
“翻译中的 Ghaib”又名“看不见的危害”:用 LLM 仇恨语音检测中的“乌尔都语缺失”分数来衡量跨脚本安全不一致
'Ghaib in Translation' aka Unseen Harm: Measuring Cross-Script Safety Inconsistency with 'Missed-in-Urdu' Scores in LLM Hate Speech Detection
摘要
乌尔都语是世界第十大语言,拥有 2.46 亿使用者,但在主流 LLM 安全评估和九年的 WOAH 程序中几乎完全缺席。为了调查这种缺失是否对内容审核可靠性产生可衡量的影响,我们在涵盖 Nastaliq 乌尔都语、罗马乌尔都语、英语和语码转换乌尔都语-英语的六个数据集上测试了五个 大语言模型、GPT-4o、Claude Sonnet 4.5、Gemini 2.5 Flash、Qwen-2.5 和 Llama-3.1。在五个乌尔都语脚本数据集中,原始脚本和英语翻译分类之间的标签不稳定性范围从 15.9% (Gemini 2.5 Flash) 到 31.6% (Qwen-2.5),其中“乌尔都语丢失”率、内容在英语翻译中被标记为有害,但在原始脚本中被视为正常,范围从 2.4% 到 9.9%(中位数 4.3%)。通过 ACL Anthology API 对 9 个 ALW/WOAH 版本的所有 205 篇论文进行了完整枚举,确认整个时期的专用乌尔都语论文为零。结果表明,当前的 LLM 为乌尔都语脚本品种提供了不均匀的安全保证,较小的开放权重模型比边境封闭模型表现出更高的不稳定性和漏失伤害率。