论文
ExtractBench:Schema引导的企业文档提取基准
ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
摘要
企业工作流程越来越依赖于代理进行 \emph{schema-引导提取}: 给定文档和用户定义的 schema,代理忠实于 schema 生成正确的输出,并将源证据作为背景元数据。我们提出了 ExtractBench,这是一个 schema-引导提取基准,到我们的知识为止,这是第一个同时评分价值准确度、记录完整性、背景元数据和测量成本的基准。评估系统包含 4,869 页跨 370 个企业文档、8 个业务领域和 67 种文档类型,有明显的标签区分其挑战场景。可扩展的 schema 和背景元数据校准管道结合了独立系统的一致性、已知值的合成列表和人工验证的表单。我们报告了价值准确度的无序值 F1,以及两个来源可追溯性的度量:词级和页级 F1。商业 VLM 在短文档上表现良好,但在长文档上常常截断记录列表,而编码代理在更高的成本下保持更高的准确度。LlamaExtract Agentic Plus 在所有三个指标上均排名第一,与编码代理相比,成本仅为其的几分之一。数据集和评估代码可在 \href{https://huggingface.co/datasets/llamaindex/ExtractBench}{HuggingFace} 和 \href{https://github.com/run-llama/ExtractBench}{GitHub} 上获得。
