论文

从 PDF 到 RAG-Ready:评估特定领域问答的文档转换框架

From PDF to RAG-Ready: Evaluating Document Conversion Frameworks for Domain-Specific Question Answering

模型评测评测方法与指标

摘要

检索增强生成 (RAG) 系统主要取决于文档预处理的质量,但之前没有研究通过 PDF 处理框架对下游问答准确性的影响来评估它们。我们通过对 4 个开源 PDF 到 Markdown 转换框架(Docling、MinerU、Marker 和 DeepSeek OCR)进行系统比较,跨越 21 个管道配置,改变转换工具、清理转换、分割策略和元数据丰富,来解决这一差距。使用包含 50 个问题的基准对 36 份葡萄牙行政文件(1706 页,约 492K 字)的语料库进行评估,并以 LLM 作为法官对每个配置进行超过 50 次独立运行的评分。通过 Wilcoxon 符号秩检验和 Cohen 的 d 效应大小评估统计显着性。两个基线限制了结果:简单的 PDFLoader (86.2%) 和手动策划的 Markdown (91.3%)。通过分层分割和图像描述进行文档记录实现了最高的自动化准确性 (94.1 +/- 1.6%),甚至超过了手动管理。针对每个问题类型的分析表明,与表格相关的问题导致了最大的准确度差异,基本划分和分层划分之间存在 33 个百分点的差距。元数据丰富和层次结构感知分块比单独的转换框架对准确性的贡献更大。探索性 GraphRAG 实现的性能低于基本 RAG(82% vs. 94.1%)。这些发现表明,数据准备质量是 RAG 系统性能的主导因素。