论文
通过关系感知视觉增强减轻 LVLM 中的动作关系幻觉
Mitigating Action-Relation Hallucinations in LVLMs via Relation-aware Visual Enhancement
摘要
大型视觉语言模型(LVLM)在各种视觉语言任务上取得了卓越的性能。然而,LVLM 仍然会产生幻觉,生成与视觉输入相矛盾的文本。现有的研究主要集中在减轻物体幻觉上,但往往忽视了更复杂的关系幻觉,特别是涉及物体之间相互作用的动作关系。在这项研究中,我们凭经验观察到 LVLM 中动作关系幻觉的主要原因是对视觉信息的关注不足。因此,我们提出了一个框架来定位与动作相关的图像区域并增强 LVLM 对这些区域的关注。具体来说,我们定义动作关系敏感度(ARS)分数来识别对动作关系变化最敏感的注意力头,从而定位包含关键视觉线索的动作相关图像区域。然后,我们提出了关系感知视觉增强(RVE)方法来增强 LVLM 对这些动作相关图像区域的关注。大量的实验表明,与现有的基线相比,我们的方法在减轻动作关系幻觉方面取得了优异的性能,而额外的推理成本可以忽略不计。此外,它有效地推广到空间关系幻觉和物体幻觉。