论文
MAD:缓解多模态大语言模型跨模态幻觉的模态自适应解码
MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Models
摘要
多模态大语言模型(MLLM)存在跨模态幻觉:一种模态不适当地影响关于另一种模态的生成,导致捏造输出。这暴露了模态间交互控制方面更根本的缺陷。为此,我们提出模态自适应解码(MAD),一种免训练方法,根据任务需求自适应加权模态专属的解码分支。MAD利用模型自我评估模态相关性的固有能力,通过查询每个任务需要哪些模态。提取的模态概率随后用于自适应加权对比解码分支,使模型能够聚焦相关信息,同时抑制跨模态干扰。在CMM和AVHBench上的大量实验表明,MAD显著降低多个视听语言模型的跨模态幻觉(VideoLLaMA2-AV在两项基准上分别提升7.8%和2.0%,Qwen2.5-Omni分别提升8.7%和4.7%)。我们的方法表明,通过自我评估实现的显式模态感知对稳健多模态推理至关重要,为现有对比解码方法提供了有原则的扩展。代码见 https://github.com/top-yun/MAD。
