论文
重新权衡证据:校准 词元级 序数视觉证据以减轻大型视觉语言模型中的幻觉
ReWEIGH the Evidence: Calibrating Token-Level Ordinal Visual Evidence to Mitigate Hallucinations in Large Vision-Language Models
摘要
大型视觉语言模型 (LVLM) 经常产生幻觉,生成输入图像不支持的内容。在解码过程中防止此类内容需要针对特定候选者来衡量图像支持所考虑的标记的强度。该模型的视觉标记状态提供了这种证据的自然来源,因为通过输出头投影每个状态可以揭示该位置偏爱哪些词汇项。这些位置读数无法直接合并,因为它们的概率大小在不同视觉位置之间不可比较。词汇排名为池化提供了尺度不变的基础,但词元在其典型的基于排名的证据中仍然存在系统性差异。我们提出了 ReWEIGH,一种 无需训练 解码干预措施,它可以跨视觉位置聚合这些排名,并将每个候选者与从未标记图像估计的特定于标记的参考进行比较。在推理时,ReWEIGH 会在预填充期间缓存图像证据,并仅对低于参考值的候选者施加有界惩罚。在四个 7B 主干上,ReWEIGH 将幻觉对象提及减少了高达 21.3%,同时在很大程度上保留或改进了描述性和一般性能。通过缓存证据,每个词元平均增加的延迟为 1.33%,并且减少范围涵盖六个架构系列,直至 32B 参数。