论文

DetailVerifyBench:长图像描述中密集幻觉定位的基准

DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions

模型评测基准与评测资源

摘要

准确检测和定位幻觉是确保图像字幕高可靠性的关键任务。在多模态 大语言模型 (MLLM) 时代,字幕已从简短的句子演变为全面的叙述,通常跨越数百个单词。这种转变呈指数级增加了挑战:模型现在必须在广泛的上下文中查明特定的错误范围或单词,而不仅仅是标记响应级别的不一致。然而,现有的基准测试缺乏评估此功能所需的细粒度和领域多样性。为了弥补这一差距,我们引入了 DetailVerifyBench,这是一个严格的基准测试,包含五个不同领域的 1,000 张高质量图像。它的平均字幕长度超过 200 个单词,并且对多种幻觉类型进行密集的 词元级 注释,成为迄今为止长图像字幕领域中精确幻觉定位最具挑战性的基准。我们的基准测试可在 https://zyx-hhnkh.github.io/DetailVerifyBench/ 上找到。