论文
通过强调负图像标记来减少 LVLM 中的物体幻觉
Reducing Object Hallucination in LVLMs via Emphasizing Image-negative Tokens
摘要
物体幻觉是阻碍大型视觉语言模型(LVLM)在实践中应用的重大挑战。我们假设幻觉的一个可能起源是模型倾向于优先考虑文本生成而不是与图像的有意义的交互。为了探索这一点,我们检查了生成过程,并根据文本标记对输入图像标记的视觉依赖性将文本标记分为三组:图像正性、不变性和负性。我们的分析表明,大多数生成的词元受图像信息的影响很小。这表明在模型的训练阶段,更多的重点放在学习如何遵循文本指令,而不是从图像中提取信息。基于这一发现,我们建议根据不同标记的视觉依赖性调整其训练权重以控制幻觉。此外,我们还删除了一部分可能包含更多幻觉的训练数据作为数据过滤策略。这两种方法都可以减少幻觉,而不会影响响应长度或在推理过程中引入额外的计算成本。我们在三种 LVLM 变体中验证了我们的方法,证明了其有效性和普遍适用性。