论文
理解和减轻多模式思维链模型中的幻觉
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
摘要
多模态思维链 (MCoT) 模型在复杂的视觉推理任务中表现出了令人印象深刻的能力。不幸的是,最近的研究表明,由于在生成过程中视觉注意力减弱,它们患有严重的幻觉问题。然而,视觉注意力衰减是大视觉语言模型(LVLM)中一个经过充分研究的问题。考虑到 MCoT 模型与传统 LVLM 推理过程的根本差异,我们提出一个基本问题:MCoT 模型是否有独特的幻觉原因?为了回答这个问题,我们系统地研究了 MCoT 模型的幻觉模式,发现虚构文本主要是在联想推理步骤中生成的,我们称之为发散思维。利用这些见解,我们引入了一种简单而有效的策略,可以有效地定位发散的思维步骤并干预解码过程以减轻幻觉。大量的实验表明,我们的方法大大优于现有方法。更重要的是,我们提出的方法可以方便地与其他幻觉缓解方法集成,并进一步提高其性能。该代码可在 https://github.com/ASGO-MM/MCoT-hallucination 上公开获取。