论文
通过内部信息分解保障多模态AI安全
Securing Multimodal AI through Internal Information Decomposition
摘要
多模态大语言模型带来了单模态系统中不存在的攻击面:攻击者可以将恶意意图分散到不同模态中,以规避单模态防护。这促使我们将跨模态一致性用作检测信号,而不是孤立地检查每个模态。我们的关键观察是:良性输入会使纯文本推理与纯视觉推理产生相互兼容的预测行为,并在融合时趋于稳定;而对抗性操纵会破坏这种一致性,导致异常的多模态行为。检查原始输入或输出的现有防御忽视了这一内部融合过程,因而脆弱且计算开销大。我们提出FlowGuard,一个轻量的推理时框架,通过监测内部多模态一致性来检测有害输入。与依赖标量置信度指标的方法不同,FlowGuard受部分信息分解(Partial Information Decomposition)启发导出FlowVector,量化跨模态冗余、协同与模态特异性主导,捕捉融合后的多模态预测是否仍与单模态语义证据保持一致。在仅用良性数据训练的单类分类问题中,FlowGuard将未见攻击上的攻击成功率从>90%降至<15%,效用损失<3%,延迟最多降低6倍。我们的结果表明,监测跨模态一致性为多模态推理提供了一种高效且有效的防御。
