论文

ParseBench:AI 代理的文档解析基准

ParseBench: A Document Parsing Benchmark for AI Agents

模型评测基准与评测资源

摘要

人工智能代理正在改变文档解析的要求。重要的是语义正确性:解析的输出必须保留自主决策所需的结构和含义,包括正确的表格结构、精确的图表数据、语义上有意义的格式和视觉基础。现有的基准测试无法完全捕获企业自动化的这种设置,依赖于狭窄的文档分布和文本相似性指标,从而错过了代理关键故障。我们引入了 ParseBench,这是一个由保险、金融和政府领域的企业文档中的 ${\sim}2{,}000$ 人工验证页面组成的基准,围绕五个功能维度进行组织:表格、图表、内容 忠实性、语义格式和视觉基础。该基准测试涵盖了涵盖视觉语言模型、专门文档解析器和 LlamaParse 的 14 种方法,揭示了碎片化的能力格局:没有一种方法在所有五个维度上都始终强大。 LlamaParse Agentic 获得了 84.9% 的最高总分,该基准测试凸显了当前系统中剩余的能力差距。数据集和评估代码可在 https://huggingface.co/datasets/llamaindex/ParseBench 和 https://github.com/run-llama/ParseBench 上获取。