论文

DocAttriBench:文档视觉问答中的基准答案基础

DocAttriBench: Benchmarking Answer Grounding in Document Visual Question Answering

模型评测基准与评测资源

摘要

文档视觉问答中的答案基础仍然是一个开放的挑战:大多数基准缺乏基础注释或提供质量有限的标签,而构建基础数据集仍然需要昂贵的手动工作。我们引入了 DocAttriBench (DAB),它是文档 VQA 中细粒度、元素级源归因的大型基准,为特定布局元素(例如文本块、表格和图像)提供了基础答案。为了构建 DAB,我们提出了一种基于掩码的困惑衍生归因方法 (MAPPET),该方法结合文档布局和语言建模来识别每个答案中信息最丰富的元素。 MAPPET 测量屏蔽候选元素后困惑度的增加,并将答案归因于对模型置信度贡献最大的元素。将 MAPPET 应用于多个现有文档 VQA 数据集可生成 DAB,其中包含 237k 个文档和 296k 个具有元素级基础的问答对。我们在 DAB 上对具有基础能力的多模式大语言模型进行基准测试,评估答案准确性、归因准确性和整体答案质量。结果表明,虽然较大的模型通常可以获得更高的答案准确性,但即使是最强大的模型也常常无法定位支持元素。 DAB 为开发可靠、可验证且值得信赖的文档 VQA 模型提供了可扩展的基准。数据集和代码可在 https://aimagelab.github.io/DocAttriBench/ 获取。