论文
立即行动:通过自适应上下文集成预防 LVLM 幻觉
ACT Now: Preempting LVLM Hallucinations via Adaptive Context Integration
摘要
大视觉语言模型 (LVLM) 经常遭受严重的幻觉问题。现有的缓解策略主要依赖于孤立的单步状态来增强视觉焦点或抑制强烈的语言先验。然而,这些静态方法忽略了生成过程中的动态上下文变化,并且难以纠正继承的信息丢失。为了解决这个限制,我们提出了自适应上下文集成(ACT),这是一种 无需训练 推理干预方法,通过上下文信息的自适应集成来减轻幻觉。具体来说,我们首先提出视觉上下文探索,它利用时空分析来自适应放大负责视觉探索的注意力头。为了进一步促进视觉-语言对齐,我们提出语义上下文聚合,边缘化潜在的语义查询以有效聚合视觉证据,从而解决由词元预测的离散性质引起的信息丢失。跨不同 LVLM 的大量实验表明,ACT 显着减少了幻觉,并在判别性和生成性基准上取得了有竞争力的结果,在不影响基本生成能力的情况下,充当了强大且高度适应性的解决方案。