论文
文档解析距离解决还有多远? PureDocBench:跨干净、降级和真实世界设置的可追溯源基准
How Far Is Document Parsing from Solved? PureDocBench: A Source-Traceable Benchmark across Clean, Degraded, and Real-World Settings
摘要
文档解析模型正在迅速改进,但现有的基准仍然不足以全面评估其能力。我们推出 PureDocBench,这是一个包含 10 个域、66 个子类别和 1,475 个页面的基准测试。每个页面都有匹配的“干净”、“数字”和“真实”版本,涵盖干净渲染、模拟退化以及真实捕获或共享条件。生成的 4,425 张图像具有来自源的文本、公式、表格和阅读顺序注释,并通过自动验证和人工审核进行检查。保持页面内容和注释固定可以跨图像条件进行直接比较。我们评估了 58 个模型,包括基于管道的解析器、端到端解析器和通用视觉语言模型。最好的三轨平均分是 79.69 分(满分 100 分),各型号的平均分是 63.84 分。与 Clean 相比,Digital 的平均得分下降了 3.34 分,Real 的平均得分下降了 11.61 分。 TeleOCR 在 Clean 上领先,GLM-5.3-Flash 在 Digital 上领先,Gemini 3.6 Flash 在 Real 上领先。基准数据集、源文档、生成工具和评估代码可在 https://github.com/zhihengli-casia/PureDocBench 上公开获取。