论文

谁为安全付出更多?衡量跨语言安全协调的不同成本

Who Pays More for Safety? Measuring the Disparate Cost of Safety Alignment across Languages

模型评测鲁棒性、公平性与可信度评测

摘要

安全调整有助于模型遵循人类价值观,但它通常会降低响应效用。我们提出一个关键但尚未得到充分研究的问题:安全一致性是否会在不同语言组之间平等地施加成本?为了回答这个问题,我们引入了严格的协议来衡量仅由安全调整造成的效用损失,我们将其称为安全成本。通过安全对齐模型和未对齐模型之间的直接成对比较,我们发现了系统性的不平等:非英语用户始终比英语用户承担更高的安全成本。我们进一步确定了三种基本模式。首先,多种语言处于双重惩罚区,安全保障较弱,效用损失较大。其次,某些语言表现出明显的效用收益,这实际上是安全过滤器未能发挥作用的结果。第三,即使是资源丰富的语言,为了达到相同的安全水平,也要比英语付出更大的安全成本。我们表明,这些差异源于多个维度的明确拒绝和隐含的定性差异。通过准确测量安全调整的不同影响,我们的研究结果揭示了当前安全调整实践中的系统差异。