论文

资源匮乏的安全失败是行动失败,而不是表现失败

Low-Resource Safety Failures Are Action Failures, Not Representation Failures

模型评测模型行为与机制分析

摘要

语言模型通常会用低资源语言(LRL)来回答有害的请求,而用高资源语言(HRL)来拒绝。在三种指令调整模型和 23 种语言中,有害拒绝从 HRL 的 87.9% 下降到 LRL 的 43.9%,而无害拒绝仍然很低。一个常见的解释是,模型在 LRL 中代表的危害性较弱。我们测试是否代表了有害性,但不能可靠地产生拒绝。在三个模型中,从 HRL 激活中学习到的危害性方向仍然将有害的 LRL 提示与无害的 LRL 提示区分开来,这表明完全缺乏危害性信息无法解释许多失败。然而,LRL 提示的危害性分数向下移动,使得有害提示不太可能达到与拒绝相关的范围。受这种转变的推动,我们在 HRL 激活上训练一个低秩逻辑分类器,并用一些目标语言示例校准其阈值。在生成过程中,分类器有条件地添加或消除 HRL 有害方向。在相同的 HRL 数据和每类 32 个目标语言示例的情况下,CAST 仍然受到低有害拒绝的限制,而 AdaSteer 则受到高无害拒绝的限制,平均拒绝选择性($Δ$ = 有害 - 无害拒绝)分别为 33.6 和 6.8。我们的干预达到 54.5,同时保留 MMLU 效用。仅 HRL 校准可提高 Qwen 和 Gemma 的选择性,而 Llama 则受益于目标语言校准。这些结果表明,重新校准现有表示可以提供用于修复低资源安全故障的 无需训练 方法。