论文
良性多语言 微调 的异质安全影响
The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning
摘要
微调 a 大语言模型 是一种增强其特定下游任务能力的普遍方法。然而,之前的工作表明,这种能力的提高是有代价的:它会增加模型对不安全的对抗性提示做出反应的倾向,即使 微调 具有非对抗性数据。我们通过 微调 Llama-3.2、Qwen3 和 Gemma-3 模型使用跨九种语言翻译的良性数据,在多语言环境中首次对这种现象进行了全面的实证研究。我们发现安全结果对 微调 语言和评估语言的选择都高度敏感,在某些情况下,对抗性合规率增加了四倍。多语言安全漂移与一般能力指标脱钩,并且跨语言和模型异构地发生。非英语语言中的 微调 通常会引起比英语更小的内部表征漂移,但这些变化会导致模型默认夸大服从或拒绝。因此,仅用英语评估 微调 的影响无法为部署提供充分的保证。为了促进对这些跨语言安全盲点的进一步研究,我们发布了 Multilingual-Benign-Tune 数据集和 SORRY-Bench-Multilingual 评估套件。