论文
R-CoV:用于减轻 LVLM 中物体幻觉的区域感知验证链
R-CoV: Region-Aware Chain-of-Verification for Alleviating Object Hallucinations in LVLMs
摘要
大型视觉语言模型(LVLM)在各种多模态理解和推理任务中表现出了令人印象深刻的性能。然而,他们仍然与物体幻觉作斗争,即视觉输入中声称物体不存在。为了应对这一挑战,我们提出了区域感知验证链(R-CoV),这是一种视觉验证链方法,可以事后缓解 LVLM 中的物体幻觉。受人类如何理解复杂的视觉信息(通常关注给定样本中的特定图像区域或细节)的启发,我们从 LVLM 本身引出此类区域级处理,并将其用作链接线索来检测和减轻他们自己的物体幻觉。具体来说,我们的 R-CoV 由六个步骤组成:初始响应生成、实体提取、坐标生成、区域描述、验证执行和最终响应生成。作为一种简单而有效的方法,R-CoV 可以以 无需训练 的方式无缝集成到各种 LVLM 中,并且无需依赖外部检测模型。对多个 LVLM 中广泛使用的幻觉基准进行的广泛实验表明,R-CoV 可以显着减轻 LVLM 中的物体幻觉。项目页面:https://github.com/Jiahao000/R-CoV。