论文

FADE:通过降低语言先验主导缓解大型视觉语言模型幻觉

FADE: Mitigating Hallucinations by Reducing Language-Prior Dominance in Large Vision-Language Models

模型推理解码与生成控制

摘要

尽管大型视觉语言模型(LVLM)能力惊人——它们仍易幻觉——生成与输入图像不一致的内容。近期研究把此归因于语言先验对视觉输入的主导——并采用对比解码方法缓解该主导——但机制起源仍未被探索。我们研究经每transformer层的信息流——发现注意力模块持续聚合视觉证据——而关键层的FFN模块充当语言先验之源。这些先验可压过视觉证据——使中间层的正确预测漂向错误输出。基于该洞见——我们提出FADE(解码的FFN衰减)——免训练方法——衰减FFN输出以降低语言先验主导。在LLaVA-1.5、mPLUG-Owl2与InstructBLIP上对POPE、CHAIR与MME基准的评估表明FADE有效缓解幻觉——同时保持推理效率。

FADE:通过降低语言先验主导缓解大型视觉语言模型幻觉:论文配图
图 1:分析通过转换器层的信息流。注意力始终聚集视觉证据,而关键层(16-22)的 FFN 引入了可以覆盖视觉证据的语言先验。