论文
VisER:LVLM 中物体幻觉检测的视觉证据和可靠性
VisER: Visual Evidence and Reliance for Object Hallucination Detection in LVLMs
摘要
物体幻觉仍然是大型视觉语言模型中持续存在的可靠性问题,其中生成的物体提及可能听起来似乎合理,但缺乏视觉基础。最近的 无需训练 检测器使用内部信号(例如标记可能性、注意力、视觉置信度或图像文本相似性)来识别幻觉对象。这些信号很有用,但它们常常是来源混乱的。它们测量模型内部对某个对象的支持程度,而不区分该支持是来自对象特定的视觉证据还是生成的文本前缀。在困难的情况下,幻觉对象仍然可以获得较高的内部支持,因为它适合场景,与附近的视觉提示相关联,或者自然地遵循生成的文本前缀。我们提出 VisER,一种用于对象级幻觉检测的 无需训练 两侧度量。 VisER 从两个互补的视图评估每个生成的对象提及。视觉证据衡量对象上下文兼容性是否得到图像标记中特定于对象的证据的支持。视觉可靠性衡量图像是否比生成的前缀更支持对象。结合这些视图可以提供更具源意识的基础分数,同时避免额外的对象级验证生成。在多个 LVLM 和基准中,VisER 在一系列基准上改进了 AUROC 和 AUPR。