论文
超越平均安全性:机会受限的大语言模型微调
Beyond Average Safety: Chance-Constrained LLM Fine-tuning
摘要
针对新目标微调大型语言模型可以提高帮助性、指令遵循或特定领域的性能,但它也可能会导致安全关键提示的回归。现有的安全保护微调方法通常控制平均安全损失或使用加权辅助惩罚,这可能会掩盖罕见但严重的故障。我们提出了一种用于安全保护微调的机会约束公式,该公式限制了相对于参考模型的退化超过规定阈值的安全示例的比例。由于所得的经验机会约束包含不连续指标,因此我们引入了违规率的可微多数化,从而产生了易于处理的保守约束。然后,我们开发了一种约束感知梯度下降方法,将主要约束视为参数空间中的安全集,并最小限度地修改微调方向以保持可行性。由此产生的更新承认封闭形式并产生尾部感知安全校正,强调接近或高于退化阈值的示例。我们对三种不同任务和三种模型的有害微调进行了广泛的实验,结果表明我们的方法始终优于文献中存在的基线。这些结果表明,LLM 微调中的安全保护最好被视为可靠性约束的优化问题,而不是平均风险正则化。