论文
为什么安全护栏会随着语言的不同而降低?
Why Do Safety Guardrails Degrade Across Languages?
摘要
大语言模型 在非英语语言中表现出安全性下降。标准评估依赖于越狱成功率(JSR),它将多个安全驱动因素混为一谈,模糊了安全失败的具体原因。我们引入了潜在变量模型,即多组项目响应理论(IRT)框架,该框架将与语言无关的安全鲁棒性($θ$)、内在提示硬度($β$)、全局语言处理难度($γ$)和提示特定的跨语言安全差距($τ$)解耦。使用 MultiJail 数据集,我们评估了 5 个封闭模型系列和 10 种不同资源语言的 61 种模型配置的安全稳健性,聚合了包含 190 万条响应的数据集。探索性因素分析表明,安全性主要是一维的:模型主要通过共享机制拒绝不同的伤害类型。与低资源语言中安全性大幅下降的预期趋势相反,22 种模型配置在英语中比在低资源语言中更容易受到攻击。低资源语言比高资源语言产生更多不确定的响应(高熵)。此外,高 $τ$ 提示聚集在盗窃和武器等物理伤害类别以及资源较低的语言中,这些趋势通过跨数据集概括得到验证。虽然全球翻译质量与 $τ$ 的相关性较低,但正如母语人士所验证的那样,严重的误译会导致高偏差异常值。文化和概念基础的不匹配也可能导致$τ$。在预测验证中,IRT 框架实现了 $\mathrm{AUC} = 0.940$,并且与速率基线不同的是,当整个语言被保留时,IRT 框架仍保持预测性 ($0.875$)。我们的框架揭示了聚合指标模糊的概念语言漏洞,从而实现更公平的跨语言安全评估和数据集构建的有针对性的改进。