论文

多语言安全信号是多层的:过滤安全性降低数据以获得更安全的大语言模型

Multilingual Safety Signals Are Multi-Layered: Filtering Safety-Degrading Data for Safer LLMs

模型训练合成数据

摘要

在大型语言模型微调期间保持安全对齐至关重要,然而,最近的研究表明,即使是良性的微调数据也可能包含安全性降低的样本,这些样本会默默地破坏安全对齐。现有方法通常使用来自单个安全敏感层的表示来识别此类样本。虽然这一假设在单语言环境中显示出有效性,但由于表示模式中潜在的跨语言差异,其对多语言模型的有效性仍不清楚。通过跨语言分析,我们表明敏感层仅部分跨语言共享,安全相关信号通常分布在多个层上。受这些观察的启发,我们提出了 MMSAFE,这是一种用于多语言安全降级数据识别的多层框架,可捕获共享和特定语言的安全信号。跨多个模型、语言和安全基准的大量实验表明,与随机过滤相比,MMSAFE 将平均有害响应率降低了 60%,并实现了比最强单层基线更强的平均性能,证明了多层建模对于稳健的多语言安全对齐的有效性。