论文

CiteVQA:可信文档情报的基准证据归因

CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 具有显着先进的文档理解能力,但当前的 Doc-VQA 评估仅对最终答案进行评分,而未检查支持证据。这种只给出答案的方法掩盖了一种关键的失败模式:模型可能会得出正确的答案,但却将其置于错误的段落中——这在法律、金融和医学等高风险领域是一个关键风险,因为在这些领域,每个结论都必须追溯到特定的来源区域。为了解决这个问题,我们引入了 CiteVQA,这是一个基准,要求模型在每个答案旁边返回元素级边界框引用,并对两者进行联合评估。 CiteVQA 包含 711 个 PDF 中的 1,897 个问题,涵盖七个领域和两种语言,平均每个文档有 40.6 页。为了确保保真度和可扩展性,真值 引文是由自动化管道生成的,该管道通过屏蔽消融来识别关键证据,并随后通过专家评审进行验证。我们评估的核心是严格属性准确性(SAA),只有当答案和引用的区域都正确时,它才认可预测。审核 20 个 MLLM 揭示了一种普遍存在的归因幻觉:模型经常在引用错误区域的同时给出正确答案。最强的系统(Gemini-3.1-Pro-Preview)的SAA仅达到76.0,最强的开源MLLM也仅达到22.5。最终,为了实现值得信赖的文档智能,CiteVQA 暴露了仅回答评估所忽视的可靠性差距,并提供了弥补这一差距所需的工具。我们的存储库位于 https://github.com/opendatalab/CiteVQA。