论文
TCAP:面向MLLM微调中无监督后门检测的三组件注意力画像
TCAP: Tri-Component Attention Profiling for Unsupervised Backdoor Detection in MLLM Fine-Tuning
摘要
微调即服务(FTaaS)便利了多模态大语言模型(MLLM)的定制,但通过投毒数据引入了关键的后门风险。现有防御要么依赖监督信号,要么无法跨多样触发类型和模态泛化。在本工作中,我们揭示了一种通用的后门指纹——注意力分配分歧:无论触发形态如何,被投毒样本都会扰乱系统指令、视觉输入和用户文本查询这三个功能组件上的平衡注意力分布。受此启发,我们提出三组件注意力画像(TCAP),一个用于过滤后门样本的无监督防御框架。TCAP将跨模态注意力图分解为三个组件,通过高斯混合模型(GMM)统计画像识别对触发敏感的注意力头,并通过基于EM的投票聚合隔离被投毒样本。在多样MLLM架构和攻击方法上的大量实验表明,TCAP取得持续强劲的性能,确立了其作为MLLM中稳健实用后门防御的地位。
