论文

通过错误发现控制的视觉数据分割减轻大型视觉语言模型中的物体幻觉

Mitigating Object Hallucination in Large Vision-Language Models via False Discovery Controlled Visual Data Splitting

模型推理解码与生成控制

摘要

多重物体幻觉,即大型视觉语言模型 (LVLM) 生成视觉输入不支持的物体,是解码过程中视觉不确定性造成的持续挑战。现有的方法使用对比信号来减少幻觉,但它们依赖于启发式方法,并且缺乏对图像级别误报的原则性控制。为了解决这个问题,我们提出了 False Discovery Rate-CONtRol of HALlucination (CORAL),这是一个免训练的框架,它使用不确定性感知的视觉数据分割策略来模拟视觉不确定性,并利用镜像统计来量化解码过程中的视觉对比度。通过计算配对、对称扰动视觉输入的镜像统计数据,CORAL 估计虚假物体预测,并设置数据驱动的阈值来控制每幅图像错误发现的预期比例,抑制幻觉,同时保留真正grounding物体的高功率。该框架非常灵活,支持多个 LVLM,并且无需重新训练或监督即可减轻幻觉。对多个基准和多个评估指标进行的广泛实验表明,CORAL 始终优于最先进的方法,提供更可靠、更强大的幻觉控制。代码可在以下位置获取:https://changliu1993-cl.github.io/CORAL/