论文

自开采安全硬度 微调

Self-Mined Hardness for Safety Fine-Tuning

模型训练监督微调与指令调优

摘要

语言模型的安全性 微调 通常需要精心策划的对抗数据集。我们采取不同的方法:根据目标模型自身的采样轨迹被判断为有害的频率来对每个候选提示的难度进行评分,然后对最难的提示与模型自己的非越狱采样轨迹进行微调。在 Llama-3-8B-Instruct 和 Llama-3.2-3B-Instruct 上,这种方法将 WildJailbreak 攻击成功率从 11.5% 和 20.1% 降低到 1-3%,但将越狱型良性提示的拒绝率从 14-22% 提高到 74-94%。将相同的硬提示与敌对框架的良性提示(看起来像越狱但具有善意意图的提示)以 1:1 的比例交错,可以将 8B 上的拒绝率降至 30-51%,将 3B 上的拒绝率降至 52-72%,但代价是攻击成功率降低了 2-6 个百分点。在混合方案中,对合格池中最难的一半而不是随机的一半进行训练,可以将两个模型的剩余 ASR 降低 35-50%(约 3 个百分点)。