论文
GradShield:保持对齐微调
GradShield: Alignment Preserving Finetuning
摘要
大语言模型 (LLM) 在微调后会带来重大的安全失调风险,因为模型可能会受到显式和隐式有害数据的损害。即使一些看似良性的数据也可能会无意中引导模型出现错误的行为。为了解决这个问题,我们引入了 GradShield,这是一种有原则的过滤方法,可以在微调期间通过识别和删除有害数据点来保护 LLM,防止它们破坏模型的对齐。它通过计算每个数据点的微调隐式危害评分 (FIHS) 来删除潜在有害数据,并采用自适应阈值算法。我们将 GradShield 应用到不同级别的有害数据的多个公用事业 微调 任务中,并使用各种指标评估生成的 LLM 的安全性和公用事业性能。结果表明,GradShield 的性能优于所有基准方法,始终将攻击成功率 (ASR) 保持在 6\%$ 以下,同时保持实用性能。