论文

MPDocBench-Parse:实用多页文档解析基准测试

MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing

模型评测基准与评测资源

摘要

文档解析将视觉丰富的文档转换为机器可读的结构化表示,形成信息系统的重要基础。尽管已经提出了许多用于文档解析的基准,但它们仍然不足以满足实际场景。现有的基准要么专注于特定任务,要么仅评估单页、以文本为中心的设置,这使得它们不足以进行实际的多页解析。此外,它们缺乏对语义连续性、层次结构恢复和视觉内容保存的细粒度评估。为了解决这些差距,我们提出了 MPDocBench-Parse,这是现实应用程序中多页面文档解析的基准。包含433​​篇人工标注文档、3246页,涵盖中英文15种文档类型,布局风格多样,支持文档级端到端评估。我们进一步设计了一个全面的内容保真度和逻辑结构协议,涵盖文本、表格和公式识别、截断的文本和表格合并、图形提取、阅读顺序和标题层次结构恢复。实验表明,虽然现有模型在基本文本提取方面表现良好,但在语义连续性集成、视觉内容解析和层次结构恢复方面仍然存在明显的局限性。 MPDocBench-Parse 为将文档解析推进到更现实的场景提供了统一的基础。