论文

我们真的需要外部工具来减轻幻觉吗? SIRA:共享前缀内部归因重构

Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

模型推理解码与生成控制

摘要

当语言先验主导弱或模糊的视觉证据时,大型视觉语言模型(LVLM)通常会产生幻觉。现有的对比解码方法通过将原始图像的预测与外部扰动的视觉输入的预测进行比较来缓解这个问题,但此类参考可能会引入流形外伪影,并且需要昂贵的额外前向传递。我们提出了 SIRA,一种 无需训练 内部对比解码框架,它通过利用多模态 Transformer 的分阶段信息流在同一 LVLM 内构建反事实参考。 SIRA 不是从输入中删除视觉信息,而是首先让图像和文本标记通过共享前缀进行交互,形成对齐的多模式状态,保留提示解释、解码历史、位置结构和早期视觉基础。然后,它在后面的 Transformer 层中分叉出一个反事实分支,其中对图像标记位置的注意力被屏蔽。该分支保留了共享的多模态上下文,但缺乏对细粒度视觉证据的持续访问,从而为 词元级 对比产生了语言优先主导的内部参考。在解码过程中,SIRA 会抑制在没有后期视觉访问的情况下保持强大的标记,并支持其优势取决于完整视觉路径的预测。使用 Qwen2.5-VL 和 LLaVA-v1.5 对 POPE、CHAIR 和 AMBER 进行的实验表明,SIRA 始终如一地减少幻觉,同时保留描述性覆盖范围,并且比两遍对比解码产生的开销更低。 SIRA 不需要训练、外部验证器或扰动输入,并且适用于具有白盒推理访问的开放权重 LVLM。