论文
哪种方式决定?多模态的反事实模态归因 LLM
Which Modality Decides? Counterfactual Modality Attribution for Multimodal LLMs
摘要
多模态 大语言模型 (MLLM) 通过结合图像和文本的补充信息,越来越多地支持高风险决策。虽然现有的可解释性方法可以识别有影响力的图像区域或文本标记,但它们无法回答一个基本问题:哪种模式驱动预测?因此,模型可能会产生正确的输出,同时依赖错误的证据来源,掩盖捷径学习和不安全的推理。我们将模态归因制定为多模态基础模型的补充可解释性目标,并提出反事实模态归因(CMA),这是量化 MLLM 中模态级别贡献的第一个框架。 CMA 使用耦合扩散先验生成纯图像、纯文本和联合多模态反事实,并通过基于 Shapley 值的合作博弈论公式将它们转换为原则模态归因分数。我们根据已知的 真值 模态依赖的受控合成基准和真实世界的多模态临床数据集来评估 CMA。 CMA 在 98% 的受控案例中正确识别了决策驱动模式,并且始终优于基线,揭示了仅靠预测准确性无法察觉的跨模式推理的失败。我们的结果将模态归因建立为特征归因之外可解释性的补充维度,为审核安全关键应用中的多模态基础模型提供了原则框架。