论文

多模态中基于补丁的跨视图正则化后门防御框架 大语言模型

A Patch-based Cross-view Regularized Framework for Backdoor Defense in Multimodal Large Language Models

模型训练模型编辑与遗忘

摘要

多模态 大语言模型 已成为统一处理视觉和语言任务的重要基础设施。然而,此类模型在监督 微调 期间非常容易受到后门植入的影响,并且一旦激活特定的触发模式,就会稳定地输出攻击者预定义的有害响应。后门防御的核心挑战在于在低中毒率下抑制攻击成功,同时保持模型的正常生成能力。这两个目标本质上是相互冲突的。强抑制通常会降低良性性能,而弱正则化则无法减轻后门行为。为此,我们提出了一个基于补丁增强和跨视图规律性的统一防御框架,它同时限制模型响应特征表示和输出分布级别的触发模式的异常行为。具体来说,补丁级数据增强与跨视图输出差异正则化相结合,利用后门响应对非语义扰动异常不变的事实,主动拉开原始视图和扰动视图的输出分布,从而显着抑制后门触发的成功率。同时,我们通过施加输出熵约束来避免模型在防御过程中的过度抑制,保证正常命令生成的质量。三种模型、两种任务和六种攻击的实验结果表明,我们提出的防御方法有效降低了攻击成功率,同时保持了高水平的正常文本生成能力。我们的工作能够在现实的低频中毒和隐蔽触发场景中安全、受控地部署大规模多模态模型。