论文
细粒度多图像物体幻觉基准
Fine-Grained Multi Image Object Hallucination Benchmark
摘要
多模态 大语言模型 (MLLM) 越来越多地部署在需要跨视觉上下文进行复杂推理的多图像场景中。然而,当前的 MLLM 从根本上仍然受到物体幻觉的限制——生成看似合理但实际上与物体不一致的描述。现有的基准主要针对单图像设置或仅提供高级多图像评估,无法系统地诊断视觉复杂性和推理需求如何触发幻觉。为了解决这一差距,我们引入了 MIOH,一种细粒度的多图像物体幻觉基准,它在三种受控对抗压力(视觉上下文尺度、感知难度、上下文偏差)下通过三种多图像推理模式(综合、比较、选择性)系统地评估四个基本任务(存在、计数、属性、位置)的物体幻觉。通过对 29 个模型的评估,我们发现即使是像 GPT-5 和 Gemini-2.5-Pro 这样最先进的系统,在不同的推理模式和任务中也会表现出不同的故障模式。我们的评估表明,幻觉不仅源于感知失败,还源于维持多个图像中的对象表示时的整合阶段限制。 MIOH 提供了一个用于分析多图像物体幻觉的受控框架,并作为开发更可靠的多模式人工智能系统的关键评估工具。