文档检索感知分块 (D-RAC):通过 PDF 规范化和多模式 Markdown 转换对企业文档进行通用检索感知摄取
Document Retrieval-Aware Chunking (D-RAC): Universal Retrieval-Aware Ingestion of Enterprise Documents via PDF Normalization and Multimodal Markdown Conversion
摘要
企业知识库上的检索增强生成 (RAG) 系统必须摄取异构文档格式(PDF、Word 文档、演示文稿和扫描件),其内容被锁定在复杂的视觉布局、多列页面和密集表格中。基于规则的提取和 OCR 会破坏阅读顺序、压平表格并丢失标题层次结构,而对提取的文本进行完全代理分块会导致高昂的标记成本和幻觉风险。我们提出了文档检索感知分块 (D-RAC),它是我们的 Web 检索感知分块 (W-RAC) 框架对任意文档格式的扩展。 D-RAC 首先将任何输入文档标准化为 PDF,利用几乎每种格式都具有忠实、确定性 PDF 渲染的事实。然后,单个多模态 LLM 通道将渲染的页面转换为检索优化的 Markdown——将表格重写为独立的散文语句并保留标题层次结构——之后分块的进行与 W-RAC 中完全相同:确定性解析为 ID 可寻址单元,然后通过标识符而不是文本进行基于 LLM 的轻量级分块规划。源文本在分块期间不会重新生成,从而保留了 W-RAC 的成本、确定性和可观察性优势,同时将每种可渲染格式解锁为一流的输入。在跨越五个企业领域的 RAG-Multi-Corpus 基准的 236 个文档、795 页 PDF 子集上,D-RAC 在 72 分钟内对整个语料库进行转换和分块,零错误,生成 1,748 个可检索的块。与前沿 LLM 的代理分块相比,D-RAC 将分块阶段输出词元减少了 95.7%,将分块成本降低了 77.8%(GPT-4.1 定价)至 85.6%(Gemini 2.5 Pro 定价),并将分块时间缩短了 75%。 D-RAC 可线性扩展至 500 多页的文档。