论文

通过 Self-蒸馏 进行多语言安全调整

Multilingual Safety Alignment via Self-Distillation

摘要

大语言模型 (LLM) 表现出严重的多语言安全错位:它们在高资源语言中拥有强大的保护措施,但在低资源语言中仍然非常容易受到越狱攻击。当前的安全对齐方法通常依赖于每种目标语言的高质量响应数据,这是昂贵且难以生成的。在本文中,我们提出了一种名为多语言Self-蒸馏(MSD)的跨语言保障转移框架。该框架将 LLM 的固有安全功能从高资源(例如英语)语言转移到低资源(例如爪哇语)语言,从而克服了对任何语言响应数据的需求。我们的框架非常灵活,可以与不同的自我蒸馏策略集成。具体来说,我们实现了两种具体方法——同策略 MSD 和 离策略 MSD——这两种方法都可以仅使用多语言查询来实现有效的跨语言安全传输。此外,我们提出了双视角安全权重(DPSW),这是一种优化 蒸馏 目标的分歧措施。通过共同考虑教师和学生双方的观点,DPSW自适应地增加对安全关键词元的惩罚权重,同时减少对非关键词元的权重。在具有代表性的 LLM 上进行的跨多种多语言越狱和实用基准的广泛实验表明,我们的方法始终能够实现卓越的多语言安全性能。值得注意的是,它可以有效地推广到更具挑战性的数据集和未见过的语言,同时保留模型的一般功能。