论文
SomaliBench Eval:在开放权重语言模型中测量英语到索马里语的拒绝差距
SomaliBench Eval: Measuring English-to-Somali Refusal Gaps in Open-Weight Language Models
摘要
大语言模型 安全评估仍然主要以英语为中心,即使模型在全球部署,资源匮乏的语言也无法得到充分评估。我们在 SomaliBench v0 上评估了四个开放权重指令调整模型,SomaliBench v0 是一个经过母语作者验证的基准,包含英语和索马里语配对的 100 个有害意图提示。 Llama-3.1-8B-Instruct、Gemma-2-9B-Instruct、Qwen-2.5-7B-Instruct 和 Aya-23-8B 均在本地运行,温度为 0,并具有相同的英文“helpful、harmless、Honest”(HHH) 系统提示。我们发现所有四个模型的英语到索马里语拒绝差距都很大,范围从 0.40 到 0.93,在配对引导下全部严格为正,并且通过精确的 McNemar 测试显着。对于三种模型来说,索马里人的不拒绝模式占主导地位,不是流畅的有害顺从,而是不明确的输出:语言错误、语无伦次或偏离主题的一代。固定的 Claude Sonnet 快照 (claude-sonnet-4-5-20250929) 将每个响应分类为拒绝、已遵守或不清楚;它的安全层拒绝了 800 个分类中的 34 个,这些分类是本地作者手动标记的。母语作者抽查在 74 个可比行上与法官达成 100% 一致(Cohen 的 $κ=1.00$)。我们仅报告总拒绝率、类别差距和可靠性统计数据;原始模型代保留在本地并且不会发布,因为其中一些可能包含有害内容。