论文
TRACE:用于 LLM 后训练 重新调整的基于轨迹的安全补丁学习
TRACE: Trajectory-Based Safety Patch Learning for LLM Post-Training Realignment
摘要
微调 即服务 (FTaaS) 平台允许用户对定制数据执行受监督的 微调 (SFT),但此管道可能会削弱模型安全对齐。为了在不重新运行完全对准的情况下恢复安全,现有的重新对准方法侧重于校准安全补丁与微调模型的集成。这些方法表现出持久的安全性与实用性的权衡:弱修复使有害行为完好无损,而更强的修复则越来越损害良性任务。本文将重点从在线校准转移到离线补丁学习,旨在学习一种在恢复安全性的同时保留特定任务功能的安全补丁。为此,我们提出 TRACE,它模拟有害的 SFT 轨迹以产生逐渐损坏的模型状态,并同时优化这些状态的安全补丁。 TRACE 在离线阶段训练安全补丁,并在所有用户检查点重复使用它,而无需针对每个用户进行校准。我们使用三个有害的 SFT 数据集以及三个实用基准来评估两个代表性模型。在六个基准和两个模型中,TRACE 始终主导着安全实用前沿。 TRACE 将安全率比最佳基线提高了 77 个百分点,同时保持了与无防御微调模型相当的实用性。