论文

ReactBench:通过系统评估的多模式幻觉的原因驱动基准

ReactBench: A Cause-Driven Benchmark for Multimodal Hallucination via Systematic Evaluation

模型评测基准与评测资源

摘要

虽然多模态 大语言模型 (MLLM) 在视觉语言理解方面取得了快速进展,但它们仍然容易产生多模态幻觉,产生与视觉输入不一致的反应。现有的基准主要侧重于检测幻觉结果,而不是评估这些失败的根本原因。此外,许多基准依赖于简单化的场景和有限的评估格式,不再挑战最先进的模型。为了解决这些限制,我们引入了 ReactBench,这是一种原因驱动的幻觉基准,具有多个任务和考试式评估格式。通过生成对抗性图像和引起幻觉的查询,ReactBench 引入了四个有针对性的任务:关系擦除、反事实属性、变更跟踪和密集计数。这些任务系统地揭示了共现偏差、语言先验、跨图像比较感知缺陷和细粒度感知瓶颈。除了基于标准准确性的评估之外,我们还利用思维链推理来识别每个任务中幻觉的细粒度子原因。广泛的评估表明,当前的 MLLM 仍然特别容易受到特定原因幻觉触发的影响,这证明了 ReactBench 作为诊断和提高多模态模型稳健性的系统性和可解释性测试平台的价值。项目页面位于 https://reactbench.github.io/。