论文
XL-SafetyBench:基于国家情境的跨文化 LLM 安全与文化敏感性基准
XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity
摘要
现有 LLM 安全基准主要以英语为中心,常依赖翻译,难以覆盖特定国家的伤害类型,也很少将文化背景中的敏感问题与普遍伤害区分评估。论文提出 XL-SafetyBench,包含10组国家—语言组合、共5,500项测试:越狱基准包含立足具体国家情境的对抗提示,文化基准在无害请求中嵌入本地敏感性。每项测试通过多阶段流程构建,结合 LLM 辅助发现、自动验证门控,以及每个国家两名独立母语标注者。为区分有原则的拒绝与理解失败,研究在攻击成功率 ASR 之外引入中性安全率 NSR 和文化敏感性率 CSR。对10个前沿模型及27个本地模型的评测发现:前沿模型的越狱稳健性与文化意识没有耦合关系,综合安全分数会掩盖各维度差异;本地模型存在近似线性的 ASR—NSR 权衡关系(r=-0.81),说明其表面安全性可能反映生成失败,而非真实对齐。基准支持更细致的多语言跨文化安全评估。