论文
多语言拒绝对齐,更安全 大语言模型
Multilingual Refusal Alignment for Safer Large Language Models
摘要
随着 大语言模型 (LLM) 在全球范围内部署,确保其跨多种语言的安全性和一致性变得至关重要。然而,不同语言之间的安全行为往往会出现不可预测的变化,这给人工智能的一致性和道德性带来了重大挑战。在这项工作中,我们系统地研究了多语言对齐的动态,探索单语言对齐是否跨语言迁移,在训练过程中如何保持语言一致性,以及由此产生的与一般知识能力的权衡。我们推出了 RefusEU,这是一个新颖的拒绝对齐数据集,涵盖 12 种欧洲语言,包括用于评估当前最先进模型的专用测试集。我们的受控直接偏好优化 (DPO) 实验提供了两个关键见解:仅用英语调整模型不足以确保跨语言安全,即使对于相同的危害类别也是如此,而根据全球 MMLU 基准衡量,多语言数据集上的训练可以在不降低总体性能的情况下提高安全性。