论文

BYORn:引导您自己的响应来保护大型视觉语言模型免受后门攻击

BYORn: Bootstrap Your Own Responses to Defend Large Vision-Language Models Against Backdoor Attacks

模型训练监督微调与指令调优

摘要

有监督的 微调 是使自回归视觉语言模型适应下游任务的主要方法。最近的工作表明,这种范式非常容易受到后门攻击,并且现有的防御措施在开放式生成环境中无效。作为回应,我们提出了 BYORn,一个后门鲁棒的 微调 框架,其动机是观察到给定相应的图像文本输入和预训练模型,中毒的目标响应在语义上通常是不可信的。 BYORn 识别此类未对齐的响应,并动态地将其替换为模型生成的替代响应,从而打破触发器和目标输出之间的相关性。所得的客观梯度对应于干净数据分布上的群体风险上限的经验估计的梯度。根据经验,BYORn 不断提高对后门攻击的鲁棒性,同时保持干净任务性能,在泛化和攻击成功率之间建立新的权衡边界。最后,我们证明 BYORn 对于专门为规避所提出的防御而设计的自适应攻击仍然有效。