论文

幻觉留下根基特征:用于选择性对象校正的验证者引导解码

Hallucinations Leave a Grounding Signature:Verifier-Guided Decoding for Selective Object Correction

模型推理解码与生成控制

摘要

大型视觉语言模型 (LVLM) 通常会产生图像中不存在的物体的幻觉。尽管最近取得了进展,但现有的缓解方法仍然缺乏可靠的物体级视觉依据诊断,因此倾向于采用粗粒度的干预措施,这可能会损害视觉理解、缩短回答并减少有真实视觉依据的物体的覆盖范围。因此,关键的挑战是在生成过程中检测每个新兴物体的提及是否得到可靠的视觉证据的支持,以便可以选择性地减轻幻觉。然而,输出置信度反映了下一个标记的合理性,而不是视觉支持,从而允许语言先验使不存在的对象显得确定。我们证明,缺失的诊断证据被编码在内在视觉依据特征(IGS)中,这是一种分布式带符号注意力模式,对于这种自信的幻觉仍然提供信息。基于IGS,我们提出了验证者引导解码(VGD),这是一种解码框架,其中轻量级验证者检查每个新兴对象提及,当提及被识别为高风险时回滚KV缓存,抑制对象及其同义词,并重新生成受影响的延续。由于 VGD 仅对被识别为高风险的对象提及进行干预,因此它可以减少对象幻觉,同时保留模型的原始视觉理解和有视觉依据的对象覆盖范围。 CHAIR 和 AMBER-G 上的实验表明,VGD 实现了最先进的物体幻觉减少:在 @rec90 处,它将 AMBER-G CHAIR 减少了 43.6\%,同时保留了 99.6\% 的有视觉依据的物体覆盖范围,并在不缩短图像描述的情况下将 CHAIR-MSCOCO CHAIR$_i$/CHAIR$_s$ 减少了 37.0\%/30.4\%。