论文

SPARD:通过相关性多样性数据选择的安全投影防御有害的 微调 攻击

SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection

模型训练监督微调与指令调优

摘要

微调 大语言模型 经常破坏其安全一致性,有害的 微调 攻击进一步放大了这个问题,其中敌对数据消除了防护措施并引发不安全行为。我们提出了 SPARD,一种防御框架,它将安全预测交替优化与相关性多样性感知数据选择相结合。 SPARD 采用 SPAG,它可以在公用事业更新和显式安全预测之间交替进行优化,并使用一组安全数据来实施安全约束。为了管理安全数据,我们引入了相关性-多样性决定点流程来选择紧凑的安全数据,平衡任务相关性和安全覆盖范围。在 GSM8K 和 OpenBookQA 上进行的四次有害 微调 攻击下的实验表明,SPARD 始终实现最低的平均攻击成功率,大大优于最先进的防御方法,同时保持较高的任务准确性。代码可在 https://github.com/shuhao02/SPARD 获取。