论文
OrthoPurify:用权重正交投影清除视觉语言模型后门
Purifying Backdoored Large Vision-Language Models by Removing Hijacked Directions
摘要
大型视觉语言模型 (LVLM) 越来越多地部署在安全关键型应用中,但它们仍然容易受到后门攻击。防御此类攻击的成本仍然很高,因为现有方法需要对干净数据进行大量再训练,或者在推理时对每个查询进行干预。为了解决这一限制,我们提出了 OrthoPurify,这是一种通过一步正交投影纯化后门模型权重的更有效方法。具体来说,通过对后门权重更新的结构分析,我们发现后门是通过将少量权重更新方向从任务适应转向后门快捷编码来编码的,这种现象我们称之为方向劫持。然而,识别这些被劫持的方向需要一个良性的参考模型,而防御者通常无法访问该模型。我们表明,通过仅在一小部分干净样本上微调预训练权重而获得的伪良性模型提供了足够的近似值,因为主要更新方向在前几个梯度步骤内稳定。 OrthoPurify 用途 这个伪良性参考可以隔离被劫持的方向,并通过权重更新的单个投影将其删除。大量实验表明,OrthoPurify 将攻击成功率降低到接近于零,同时在不同的基准测试中保持原始性能,而无需重新训练后门模型或引入推理时间开销。我们的代码可在 https://github.com/womeimingzi/OrthoPurify。 上公开获取
