论文
通过扩展训练时间对抗性攻击来防御恶意微调
Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks
摘要
恶意微调攻击对开放权重 大语言模型 (LLM) 构成重大安全威胁。然而,现有的对齐阶段防御对于使用全参数微调的强攻击提供的保护有限。为了解决这个问题,我们提出了 Patcher,一种新颖且高效的对抗训练算法,它在攻击阶段和防御阶段之间交替:攻击阶段模拟多步恶意微调,并将所得参数位移计算为“攻击向量”,而防御阶段旨在在此类扰动下保持安全行为。与其他对抗训练方法相比,Patcher 的一个关键特点是攻击向量可以在多个防御更新中重复使用,从而大大降低训练成本。从理论上讲,我们描述了训练期间和攻击向量重用期间攻击步骤数如何影响相对梯度估计误差。根据经验,实验结果表明,与第二好的方法相比,Patcher 在三个基准测试中将攻击成功率降低了 67.5%、53.4% 和 54.8%,同时保留了模型的实用性。此外,Patcher 在不同的模型大小和攻击场景下仍然有效,并推广到基于提示的越狱攻击。代码可在 https://github.com/haomingwen/patcher 获取