论文
超越视觉增强:自适应多上下文转向减轻 LVLM 幻觉
Beyond Visual Enhancement: Adaptive Multi-Context Steering to Mitigate LVLM Hallucinations
摘要
幻觉仍然是大视觉语言模型(LVLM)中的一个重大挑战。现有的免训练方法通常通过对比解码或视觉增强来减轻幻觉,通常会增加视觉证据在生成过程中的相对影响。这就提出了一个基本问题:LVLM 能否动态调节不同上下文源的贡献来抑制幻觉?在这项工作中,我们研究并量化了 LVLM 在解码过程中如何协调多个上下文源,并研究这种内在行为如何指导幻觉缓解。我们发现 LVLM 表现出一种内在的视觉关注倾向,可以指导自适应视觉转向,而文本上下文也有助于缓解幻觉。受这些发现的启发,我们提出了 AIMS(自适应信息多源引导),这是一种轻量级的免训练框架,可以在解码过程中自适应地协调视觉、预填充文本和生成的上下文。具体来说,AIMS 为三个上下文域构建了紧凑的原型并进行了估计 它们与当前查询的亲和力以确定头向转向权重。由此产生的多源转向方向应用于查询表示,从而无需额外的模型训练或辅助前向传递即可实现自适应上下文集成。跨多个 LVLM 和解码策略的大量实验表明,AIMS 可以有效减轻物体幻觉,同时保持有竞争力的通用多模态能力。