论文

用于减轻大视觉语言模型中幻觉的预填充时间干预

Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models

模型推理解码与生成控制

摘要

大视觉语言模型(LVLM)在视觉文本理解方面取得了显着进展,但其可靠性受到幻觉的严重破坏,即产生事实上不正确或不一致的反应。虽然最近使用引导向量的研究证明了减少幻觉的希望,但仍然存在一个显着的挑战:它们无意中放大了残留幻觉的严重程度。我们将此归因于他们对解码阶段的专注,其中错误会自回归累积并逐渐恶化随后的幻觉输出。为了解决这个问题,我们提出了预填充时间干预(PTI),这是一种新颖的转向范例,在预填充阶段仅干预一次,从而在错误累积发生之前增强初始键值(KV)缓存。具体来说,PTI 具有模态感知能力,可以为视觉和文本表示得出不同的方向。这种干预是解耦的,可以将关键点转向视觉基础的物体和值,以过滤背景噪音,从源头纠正容易产生幻觉的表征。大量实验证明了 PTI 在减轻幻觉方面的显着性能及其在不同解码策略、LVLM 和基准中的通用性。此外,PTI 与现有解码阶段方法正交,可实现即插即用集成并进一步提升性能。代码位于:https://github.com/huaiyi66/PTI。