论文

超越安全数据:带定期安全反思的预训练阶段对齐

Beyond Safe Data: Pretraining-Stage Alignment with Regular Safety Reflection

模型训练预训练

摘要

为实现大语言模型(LLM)的更深安全对齐——近期努力研究如何把安全干预更早推入预训练阶段——主要通过过滤不安全数据或改写为更安全形式。我们主张预训练阶段对齐应超越使数据安全:LLM可能把看似无害的知识与能力组合成不安全行为。为此——我们提出安全反思预训练——预训练阶段对齐方法——定期在预训练语料中插入简短安全反思——把自我监控直接整合进语言建模——建立随后由兼容后训练强化的基础能力。我们在FineWeb-Edu上预训练1.7B模型的实验表明:安全反思预训练改进安全分类准确率——并大幅降低推理阶段与微调攻击的成功率。作为真实实验的补充——我们还引入完全受控的合成环境MedSafetyWorld——带清晰的安全定义与模型易于从安全数据泛化出不安全行为的推理结构。MedSafetyWorld中的消融进一步表明:与数据过滤和改写相比——安全反思预训练在防止模型执行从安全数据泛化出的不安全行为上具有明显优势。综合起来——我们的发现提示预训练对齐不仅应使训练数据安全——还应塑造模型可能从安全数据习得的行为。

超越安全数据:带定期安全反思的预训练阶段对齐:论文配图
图 1:安全反射预训练 (SRP) 概述。顶行和左下角的示例说明了我们在预训练语料库上的数据管道:我们将每个文本分成片段,并在每个片段后插入一个简短的安全反射,以便模型学会定期判断其生成的安全性。右下角的条形图报告了 SRP 相对于标准预训练的攻击成功率(ASR,越低越好),其中 SRP 在每个指标上都表现最佳。 GCG 是两个基准(AdvBench 和 DirectHarm4)的平均 ASR; Benign 表示良性微调(在 GSM8K 上),Adversarial 表示对抗性微调(在 Harmful HEx-PHI 上)。