论文

GDP.pdf:针对专业 PDF 文档的基于多模态推理的基准测试

GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents

模型评测基准与评测资源

摘要

专业领域的大部分日常工作都发生在 PDF 文件中:福利包、租赁、数据表、临床指南、施工计划。文档 AI 的基准通常单独衡量所需的功能:OCR、布局分析、图表推理、表格 QA、文档 VQA。其中任何一项的高分并不一定表明模型是否可以回答该领域的人员实际上会询问特定 PDF 的实际问题。 GDP_pdf 是为直接衡量这一点而构建的基准。它由十个领域的专业人士撰写的问题-文档对组成,只有当至少两个前沿多模态模型以某种重要方式失败时,候选问题才会被保留:错误的答案、错过的决定性证据或捏造的主张,而不是诸如风格之类的表面差异。每个项目都带有原子标准的标题,因此我们可以报告分级标题分数以及严格的任务级通过率,并且每个项目都根据三层十一个功能的分类进行标记,涵盖文本提取和证据定位、表格和图表理解、交叉引用、空间推理以及对不支持的查询的放弃。我们报告了 17 个前沿模型在 100 项基准上的结果:最好的模型仅通过了 30.7% 的项目,最差的模型通过了 2%。大多数错误都可以追溯到一小部分重复出现的丢失模式:未对齐的表格、误读的图表、跳过的脚注和排除、错误计数的平面图符号、扫描噪声以及取代先前文本的修改。