论文

焦点问题:视觉语言模型中幻觉的阶段感知抑制

Focus Matters: Phase-Aware Suppression for Hallucination in Vision-Language Models

模型推理推理验证与自校正

摘要

大视觉语言模型(LVLM)在多模态推理方面取得了令人印象深刻的进展,但它们仍然容易产生物体幻觉,生成输入图像中不存在的物体的描述。最近的方法试图通过抑制视觉编码器中不可靠的视觉信号来减轻幻觉,但许多方法依赖于每个输入的迭代优化,从而导致大量的推理延迟。在这项工作中,我们研究了 LVLM 中视觉编码器的内部注意力动态,并确定了视觉信息处理的一致的三相结构:扩散、聚焦和再扩散。我们的分析表明,幻觉行为对于在焦点阶段受到低关注的词元特别敏感。受这一观察的启发,我们提出了一种轻量级的推理时间干预,可以在焦点阶段选择性地抑制此类标记。该方法使用来自单个前向传递的统计数据以 无需训练 方式运行,并采用行列式点过程 (DPP) 来保留不同的视觉线索,同时过滤冗余标记。跨多个 LVLM 主干和解码策略的广泛实验表明,所提出的方法能够持续减少幻觉指标,同时保持有竞争力的图像描述质量。此外,与对抗性不确定性估计方法相比,我们的方法以可忽略的额外推理延迟实现了类似的幻觉缓解。