论文

OrthoPurify:用权重正交投影清除视觉语言模型后门

Purifying Backdoored Large Vision-Language Models by Removing Hijacked Directions

模型评测模型训练监督微调与指令调优模型编辑与遗忘安全与风险评测

摘要

大型视觉语言模型 (LVLM) 越来越多地部署在安全关键型应用中,但它们仍然容易受到后门攻击。防御此类攻击的成本仍然很高,因为现有方法需要对干净数据进行大量再训练,或者在推理时对每个查询进行干预。为了解决这一限制,我们提出了 OrthoPurify,这是一种通过一步正交投影纯化后门模型权重的更有效方法。具体来说,通过对后门权重更新的结构分析,我们发现后门是通过将少量权重更新方向从任务适应转向后门快捷编码来编码的,这种现象我们称之为方向劫持。然而,识别这些被劫持的方向需要一个良性的参考模型,而防御者通常无法访问该模型。我们表明,通过仅在一小部分干净样本上微调预训练权重而获得的伪良性模型提供了足够的近似值,因为主要更新方向在前几个梯度步骤内稳定。 OrthoPurify 用途 这个伪良性参考可以隔离被劫持的方向,并通过权重更新的单个投影将其删除。大量实验表明,OrthoPurify 将攻击成功率降低到接近于零,同时在不同的基准测试中保持原始性能,而无需重新训练后门模型或引入推理时间开销。我们的代码可在 https://github.com/womeimingzi/OrthoPurify。 上公开获取

OrthoPurify:用权重正交投影清除视觉语言模型后门:论文原图
图 1:OrthoPurify 概述。对后门权重更新的 SVD 分析揭示了方向劫持:大多数主方向与良性参考共享(θ<30∘\theta<30^{\circ}),而少数方向几乎正交(θ>70∘\theta>70^{\circ})并专门对后门进行编码。通过在一个小的干净集合上微调预训练权重几个梯度步骤来获得伪良性参考,提供了足够的近似值。 OrthoPurify 通过主角阈值确定被劫持的方向,并通过单个正交投影将其删除。