论文
揭示大视觉语言模型中的多视图幻觉
Revealing Multi-View Hallucination in Large Vision-Language Models
摘要
大型视觉语言模型 (LVLM) 越来越多地应用于从不同视点捕获的多视图图像输入。尽管使用量不断增加,但当前的 LVLM 经常会由于非目标实例或视点的视觉干扰而产生错误的响应,我们将这种现象称为多视图幻觉 (MVH)。为了系统地分析这个问题,我们构建了 MVH-Bench,这是一个包含 4.8k 个问答对的基准测试,针对两种类型的幻觉:跨实例和跨视图。经验结果表明,MVH 在最近的 LVLM 中很普遍。为了解决这个问题,我们提出了参考移位对比解码(RSCD),这是一种 无需训练 解码技术,通过注意掩蔽生成负 logits 来抑制视觉干扰。使用 LLaVA-OneVision 和 Qwen2.5-VL 在 MVH-Bench 上进行的实验表明,RSCD 比现有幻觉缓解方法的性能提高了 25.7 点和 94.8 点,凸显了 RSCD 的有效性。