论文

EntropyScan:通过视觉注意力熵实现 LVLM 中的模型级后门检测

EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

大型视觉语言模型 (LVLM) 在各种任务中表现出了卓越的能力,但它们仍然容易受到后门攻击。现有的防御方法主要集中在样本级防御,这依赖于训练数据或触发器的知识。然而,识别给定模型是否存在后门仍然是一项关键但尚未探索的任务。为了填补这一空白,我们提出了 EntropyScan,这是一种轻量级且与触发无关的方法,用于 LVLM 中的模型级后门检测。我们首先观察到后门注入破坏了跨模式对齐,导致良性样本的视觉注意力分配出现明显的结构异常。基于这一见解,EntropyScan 通过量化此类注意力偏差来检测后门模型。具体来说,它从 大语言模型 (LLM) 的初始层中提取视觉注意力分布,并应用 Tsallis 熵来捕获这些结构扭曲。通过对一小组良性样本采用参考锚定 Z 分数归一化,它可以有效地识别后门模型。跨两种 LVLM 架构和三种高级攻击场景的大量实验表明,EntropyScan 的平均 F1 分数为 98.5%,AUC 为 96.6%。我们的代码很快就会公开。