论文

通过低秩防御和电路引导代理进行高效的 LLM 对抗训练

Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates

模型训练参数高效训练

摘要

对抗性训练是对抗对抗性攻击最有效的防御方法之一,但计算成本在现代规模下仍然令人望而却步,尤其是对于 大语言模型 (LLM)。尽管已经开发了现有的缓解策略,例如潜在对抗训练(LAT),但它们仍然会产生很高的计算成本。在这项工作中,我们重点关注基于 LLM 的分类器,从两个互补的角度研究加速 LAT 的计算效率策略:(1)防御端优化:我们探索 LAT 中的表示 微调 (ReFT),并揭示如果应用 ReFT 和攻击的词元不匹配的潜在问题。 (2)攻击端优化:在每次LAT迭代中计算对抗性攻击时,我们仅从LLM中提取相关电路来构建轻量级代理模型,避免了攻击生成过程中向前向后遍历完整模型的计算。对于这两种观点,我们提供了理论依据和数值证据来说明所提出策略的有效性。与具有完整 微调 的标准 LAT 相比,我们的方法平均将每步对抗训练 FLOP 减少了 29.6%,同时仅需要 0.0118% 的可训练参数,鲁棒性成本适中。