论文
全局上下文还是局部细节?通过自适应视觉证据定位缓解幻觉
Global Context or Local Detail? Adaptive Visual Grounding for Hallucination Mitigation
摘要
由于过度依赖语言先验,视觉语言模型 (VLM) 经常受到物体幻觉的破坏,产生与视觉现实相矛盾的内容。我们引入正负解码 (PND),这是一种 无需训练 推理框架,可直接干预解码过程以增强视觉保真度。 PND 的动机是我们在 VLM 中发现了严重的注意力缺陷,其中视觉特征根据经验加权不足。我们的框架通过双路径对比纠正了这一点:正路径使用多层注意力来放大显着的视觉证据,以鼓励忠实的描述,直接抵消注意力缺陷。同时,负面路径识别并降低了核心对象的特征,以创建一个强大的反事实,从而惩罚不证据定位气的、先验的主导一代。通过在每一步从这两个角度对比模型的输出,PND 引导生成的文本不仅在语言上可能,而且在视觉上也是真实的。对 POPE、MME 和 CHAIR 等基准测试的大量实验表明,PND 实现了最先进的性能,准确度提高了 6.5%,大幅减少了物体幻觉,同时增强了描述细节——所有这些都不需要任何模型重新训练。该方法可以有效地推广到不同的 VLM 架构,包括 LLaVA、InstructBLIP、InternVL 和 Qwen-VL。