论文

KnowHal:知识驱动的综合多模态幻觉评测基准

KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation

模型评测基准与评测资源

摘要

hallucination仍然是开发可信赖的多模态大语言模型(multimodal large language models,MLLMs)的关键挑战。尽管现有的基准测试主要关注实体、属性和关系的 hallucation,而知识相关的失败通常被单独研究,缺乏跨不同 hallucation 维度统一评估框架。为克服这一问题,我们提出了一项名为 KnowHal 的基准测试,该基准测试将知识性的 hallucination 引入到多模态 hallucination 的评估中,覆盖四个维度:实体、属性、关系和知识。KnowHal 构建了共享图像和实体的对齐正负面问题,使感知错误、知识相关的错误和虚假前提接受之间的可控比较成为可能。基准测试包含 1,800 个样本,跨越 10 个领域和 50 个类别,通过半自动化的管道结合 LLM 辅助、CLIP 基于过滤以及人工验证构建而成。我们评估了 14 个代表性 MLLMs 在 KnowHal 上,并进行了广泛的分析。结果表明,知识维度几乎对所有评估模型都构成了最大的挑战,而大多数模型在负面问题上表现出显著的性能下降,揭示了对虚假前提的鲁棒性不足。通过将四维 hallucation 维度统一设计成对齐问题,KnowHal 解决了现有基准测试框架中的一个重要缺口,并使 MLLMs 中的 hallucinations 更为全面地评估。

KnowHal:知识驱动的综合多模态幻觉评测基准:论文配图
图 1:MLLM 中两种幻觉的说明:感知级幻觉 (a-c) 涉及实体、属性和关系维度,而知识级幻觉 (d) 引入知识维度,需要视觉感知之外的外部世界知识。