论文

聚光灯和阴影:用于缓解 MLLM 幻觉的注意力引导双锚内省解码

Spotlight and Shadow: Attention-Guided Dual-Anchor Introspective Decoding for MLLM Hallucination Mitigation

模型推理解码与生成控制

摘要

多模态 大语言模型 (MLLM) 已表现出卓越的推理能力,但仍会产生幻觉,即生成的文本与视觉内容相矛盾。在本文中,我们介绍了双锚内省解码(DaID),这是一种新颖的对比解码框架,它通过挖掘模型的内部感知差异来动态校准每个词元生成。具体来说,DaID 识别出一个 Spotlight 层来放大视觉事实信号,并识别一个 Shadow 层来抑制文本惰性。通过利用视觉注意力分布来指导这个双锚选择过程,我们的方法确保了精确的、特定于词元的适应。多个基准和 MLLM 的实验结果表明,DaID 可以显着减轻幻觉,同时增强一般推理能力。