论文
TukaBench:基于文化的非洲语言越狱基准
TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages
摘要
大语言模型 (LLM) 的安全性评估仍然主要以英语为中心,而对低资源语言 (LRL),特别是非洲语言的探索严重不足。我们推出了 TUKABENCH,这是一种针对七种非洲语言的越狱基准,它通过四种设置将 JailbreakBench (JBB) 扩展到直接翻译之外:JBB 提示的人工翻译、针对非洲语境的英语适应,然后进行人工翻译、通过与 GPT-5.2 交互验证的人工策划提示,以及结合英语和非洲语言的代码转换提示,隔离语言、文化基础和提示回避对模型安全的影响。在封闭式和开放式模型中,相对于英语,用非洲语言进行提示可以减少拒绝,并且根据文化进行调整的提示可以减少拒绝的情况。该评估还暴露了两个结构性限制:模型理解失败和 LRL 中 LLM 作为法官的可靠性降低。为了解决第一个问题,我们将偏转与拒绝和越狱一起引入;为了评估第二个,我们用人工注释验证输出,结果表明,在资源较低的语言和不太常见支持的脚本中,法官与人类的一致性下降。