论文

Dr.DocBench:专家级高难度文档解析的综合基准

Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing

模型评测基准与评测资源

摘要

文档解析和识别是视觉语言模型 (VLM) 和文档处理系统的基本功能。然而,现有的光学字符识别 (OCR) 和文档解析基准在覆盖范围和难度方面越来越受到限制:许多基准侧重于现代解析器已经表现强劲的常见文档类型或统一采样的页面,同时为专家领域结构(如化学公式、音乐符号、复杂表格和跨页面布局)提供有限的注释。我们介绍 Dr.DocBench,这是一个用于专家级文档解析的难度感知基准。 Dr.DocBench 基于大型多语言图书语料库构建,涵盖 52 个 BISAC 主题领域,并通过基于解析器失败的采样选择具有挑战性的文档,针对多个最先进系统陷入困境的案例。它包含平均约 100 页的长文档中的 4,514 个带注释的页面,以及用于布局、阅读顺序、层次关系和特定领域视觉内容的 65k 高质量页面和块级注释。对基于管道的解析器和通用 VLM 的评估表明,现有基准测试的强大性能并没有转移到我们的专家级文档解析上。我们的分析揭示了跨主题、内容类型和结构属性的重大失败,强调了 Dr.DocBench 作为诊断和推进文档智能的综合测试平台。