论文
rabicdialectsafety:阿拉伯语内容安全分类的方言感知基准
ArabicDialectSafety: A Dialect-Aware Benchmark for Arabic Content Safety Classification
摘要
我们推出了阿拉伯语方言安全 (ArabicDialectSafety),这是一个人工管理的阿拉伯语安全数据集,包含 25,071 条提示,涵盖六种阿拉伯语变体:现代标准阿拉伯语、叙利亚语、埃及语、阿尔及利亚语、巴勒斯坦语和摩洛哥语。该数据集用方言标签和七个细粒度的危害类别进行注释。我们引入了一个双任务评估框架,用于跨方言的二元安全/不安全检测和粒度危害分类。对七个监督和生成模型进行基准测试,我们发现经过微调的 MARBERTv2 实现了最强的性能,二元分类的 Macro-F1 分数为 0.95,粒度分类的 Macro-F1 分数为 0.90,大大优于提示前沿 LLM,包括阿拉伯语专用模型。我们的分析表明,在表征级别进行集成时,方言调节最为有效,而资源匮乏的马格里布方言仍然存在显着的性能差距。我们进一步评估了七个前沿 LLM 作为有害方言阿拉伯语提示的响应生成器,并观察到跨模型的不安全生成率低于 5%。我们在接受后发布数据集和代码,以支持未来对方言感知的阿拉伯语安全评估的研究。警告:本文包含有害和可能令人反感的内容示例,仅用于研究目的。