论文
轻量级且可用于生产的 PDF 视觉元素解析
Lightweight and Production-Ready PDF Visual Element Parsing
摘要
PDF 文档包含关键的视觉元素,例如图形、表格和表单,其准确提取对于文档理解和多模式检索增强生成 (RAG) 至关重要。现有的 PDF 解析器经常会错过复杂的视觉效果、提取非信息性工件(例如水印、徽标)、生成碎片元素,并且无法可靠地将图注与其相应元素关联起来,这会降低下游检索和问题解答的性能。我们提出了一个轻量级的生产级 PDF 解析框架,它可以结合空间启发式、布局分析和语义相似性来准确检测视觉元素并关联图注。在流行的基准数据集和内部产品数据上,所提出的解决方案实现了 $\geq96\%$ 视觉元素检测精度和 $93\%$ 图注关联精度。当用作多模式 RAG 的预处理步骤时,它在内部数据和 MMDocRAG 基准测试上的性能显着优于最先进的解析器和大型视觉语言模型,同时将延迟降低超过2倍。我们已在具有挑战性的生产环境中部署了所提出的系统。