论文

MAD:缓解多模态大语言模型跨模态幻觉的模态自适应解码

MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Models

模型推理解码与生成控制

摘要

多模态大语言模型(MLLM)存在跨模态幻觉:一种模态不适当地影响关于另一种模态的生成,导致捏造输出。这暴露了模态间交互控制方面更根本的缺陷。为此,我们提出模态自适应解码(MAD),一种免训练方法,根据任务需求自适应加权模态专属的解码分支。MAD利用模型自我评估模态相关性的固有能力,通过查询每个任务需要哪些模态。提取的模态概率随后用于自适应加权对比解码分支,使模型能够聚焦相关信息,同时抑制跨模态干扰。在CMM和AVHBench上的大量实验表明,MAD显著降低多个视听语言模型的跨模态幻觉(VideoLLaMA2-AV在两项基准上分别提升7.8%和2.0%,Qwen2.5-Omni分别提升8.7%和4.7%)。我们的方法表明,通过自我评估实现的显式模态感知对稳健多模态推理至关重要,为现有对比解码方法提供了有原则的扩展。代码见 https://github.com/top-yun/MAD。

MAD:缓解多模态大语言模型跨模态幻觉的模态自适应解码
图2:MAD 总体流水线。给定视听输入与一个问题,MAD 通过查询模型以识别相关模态,提取模态自适应权重 [步骤 1]。在生成过程中,MAD 利用这些权重融合由四种模态配置计算的对比 logits,从而动态强调相关模态 [步骤 2]。在此示例中,尽管视频中可见一把锤子,MAD 通过优先考虑音频内容正确预测“No”,而基线由于跨模态干扰预测“Yes”。这表明 MAD 通过自适应的、问题感知的解码,有效缓解了视频驱动的音频幻觉。