论文

模态冲突幻觉中注意力头失衡的因果证据

Causal Evidence for Attention Head Imbalance in Modality Conflict Hallucination

模型评测模型行为与机制分析

摘要

模态冲突幻觉发生在多模态大语言模型(MLLM)优先采信错误文本前提而忽视与之矛盾的视觉证据之时。为了理解为何视觉证据在生成过程中未能占优,我们采用机制视角,考察哪些内部组件驱动或抵制这种失败。我们使用路径修补(path patching)在五个开源MLLM上进行头级别的因果分析,识别出两组具有相反因果作用的注意力头:幻觉驱动头与幻觉抵抗头。我们发现一种一致的不对称性:驱动效应分布更广且聚合权重更大,而抵抗效应集中在少数高重要性头上。消融实验进一步证实这两组在生成过程中施加相反的作用:分布式的驱动影响与局部化的抵抗共同形成一种失衡的路由结构,使生成偏向错误前提。基于这一发现,我们提出MACI(Modality-conflict-Aware Causal Intervention,模态冲突感知因果干预),一种仅在检测到冲突时才抑制经因果识别的幻觉驱动头的条件干预方法。在五个MLLM上,MACI在MMMC基准上取得所比较的推理时基线中最大的幻觉降幅,且幻觉-准确率权衡良好,并能零样本迁移到SCI-SemanticConflict测试。

模态冲突幻觉中注意力头失衡的因果证据:论文配图
图 2:Qwen2.5-VL-7B 中的幻觉驱动(ℋ+\mathcal{H}^{+},红色)和幻觉抵抗(ℋ−\mathcal{H}^{-},蓝色)头。顶部:逐层重要性和每层总和。底部:排名头和累积重要性。所有模型的结果见附录 0.B。