论文

通过从粗到细的视觉处理提高文档解析效率和性能

Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing

摘要

文档解析是一项细粒度的任务,其中图像分辨率会显着影响性能。虽然利用视觉语言模型的高级研究受益于高分辨率输入来提高模型性能,但这通常会导致视觉标记数量呈二次方增加,并显着提高计算成本。我们将这种低效率归因于文档图像中大量视觉区域冗余,例如背景。为了解决这个问题,我们提出了 PaddleOCR-VL,这是一种新颖的从粗到细的架构,它专注于语义相关的区域,同时抑制冗余区域,从而提高效率和性能。具体来说,我们引入了一个轻量级的有效区域聚焦模块(VRFM),它利用本地化和上下文关系预测功能来识别有效的视觉标记。随后,我们设计并训练了一个紧凑而强大的 0.9B 视觉语言模型(PaddleOCR-VL-0.9B)来执行详细识别,由 VRFM 输出引导,以避免直接处理整个大图像。大量实验表明,PaddleOCR-VL 在页面级解析和元素级识别方面均实现了最先进的性能。它的性能显着优于现有解决方案,与顶级 VLM 相比具有强大的竞争力,并在使用更少的视觉标记和参数的同时提供快速推理,突出了有针对性的从粗到精解析的有效性,以实现准确高效的文档理解。源代码和模型可在 https://github.com/PaddlePaddle/PaddleOCR 上公开获取。