论文
超越安全数据:带定期安全反思的预训练阶段对齐
Beyond Safe Data: Pretraining-Stage Alignment with Regular Safety Reflection
摘要
为实现大语言模型(LLM)的更深安全对齐——近期努力研究如何把安全干预更早推入预训练阶段——主要通过过滤不安全数据或改写为更安全形式。我们主张预训练阶段对齐应超越使数据安全:LLM可能把看似无害的知识与能力组合成不安全行为。为此——我们提出安全反思预训练——预训练阶段对齐方法——定期在预训练语料中插入简短安全反思——把自我监控直接整合进语言建模——建立随后由兼容后训练强化的基础能力。我们在FineWeb-Edu上预训练1.7B模型的实验表明:安全反思预训练改进安全分类准确率——并大幅降低推理阶段与微调攻击的成功率。作为真实实验的补充——我们还引入完全受控的合成环境MedSafetyWorld——带清晰的安全定义与模型易于从安全数据泛化出不安全行为的推理结构。MedSafetyWorld中的消融进一步表明:与数据过滤和改写相比——安全反思预训练在防止模型执行从安全数据泛化出的不安全行为上具有明显优势。综合起来——我们的发现提示预训练对齐不仅应使训练数据安全——还应塑造模型可能从安全数据习得的行为。
