论文
HIVE:理解视觉语言模型中的幻觉后推理
HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models
摘要
视觉语言模型(VLM)中的幻觉通常被视为语义错误,但它们通常源于部分或模糊的视觉证据。之前的工作主要集中在检测或抑制生成时的幻觉,而随后的推理阶段基本上未被探索。在这项工作中,我们研究幻觉后推理(PHR),幻觉语义进入模型的推理上下文并影响下游预测的阶段。为了系统地研究 PHR,我们引入了 HIVE(幻觉推理和验证引擎),这是一种评估基础设施,可以在真实图像描述和幻觉图像描述之间进行受控比较。在九个任务和九个模型中,我们观察到结构化模态依赖模式:幻觉图像描述通常可以提高视觉语言任务的准确性,而纯文本任务则表现出有限或不稳定的效果。进一步的分析表明,幻觉线索扩大了语义覆盖范围并重塑了推理动态,同时保持了稳定的推理。这些发现强调,一旦进入模型的推理上下文,幻觉语义可能会影响下游推理。了解幻觉后阶段对于提高多模态推理系统的可靠性和可解释性非常重要。代码可在 https://github.com/hefengcs/HIVE 上公开获取。