论文
通过零空间投影对 LoRA 调谐的 LLM 进行后门纯化
Backdoor Purification for LoRA-Tuned LLMs via Null-Space Projection
摘要
随着大语言模型(LLM)和参数高效微调(PEFT)方法的快速采用,后门攻击的风险变得更加严重。现有的后门净化方法通常依赖于至少一种强有力的假设,例如触发器的先验知识、干净参考的访问或积极的再训练,并且它们通常缺乏全面的评估。这些限制极大地限制了它们的实际适用性。为了克服这些挑战,我们的工作建议在没有这些假设的情况下纯化 LoRA 调整的 LLM,甚至无需对可疑参数进行事后重新训练。我们的目标是显着降低攻击成功率 (ASR),同时保留 (i) 基本模型的一般功能和 (ii) 通过适配器学习的新下游技能。通过一系列消融研究,我们逐步将我们的方法从文本分类设置中的单层扩展到生成任务中的全参数大语言模型。通过仔细的数据管理和特征近似,我们提取高保真后门方向,并针对每一层或头部,在输入和输出通道中构造正交零空间,LoRA 更新将投影到该零空间上。根据经验,我们的零空间投影方法将 ASR 从近 100% 降低到不到 10%,同时保留基础模型的良性性能和适配器在下游任务适应期间的学习能力。