论文
LayoutLite:词元级 隐式布局分析,实现高效文档 OCR
LayoutLite: Token-Level Implicit Layout Analysis for Efficient Document OCR
摘要
基于视觉语言模型的端到端OCR系统在复杂文档OCR方面取得了强大的性能,但其效率受到文档图像产生的大量视觉标记的限制。其中许多标记对应于空白边距或视觉冗余区域,但直接应用通用视觉标记压缩方法可能会删除 OCR 关键的细粒度细节。在本文中,我们提出了 LayoutLite,一个用于高效文档 OCR 的轻量级即插即用模块。 LayoutLite 不依赖显式文档布局检测,而是在视觉编码器和语言解码器之间的 词元级 处执行隐式布局分析。它聚合来自视觉编码器的多层视觉表示,并使用轻量级评分网络预测每个视觉标记的重要性得分。然后,低信息标记在进入语言解码器之前被删除,同时保留保留标记的原始空间位置信息。为了在没有人工注释的情况下训练 LayoutLite,我们将标记选择视为强化学习问题,并使用由 OCR 输出一致性驱动的组相关策略优化目标以及辅助布局监督信号来稳定训练来优化它。 OmniDocBench 上的实验表明,LayoutLite 可以显着减少视觉标记长度和推理成本,而识别质量的下降可以忽略不计。我们在两个 OCR 专用 VLM(FireRed-OCR 和 Logics-Parsing-V2)上进一步评估 LayoutLite。在高达 50% 的词元压缩下,LayoutLite 在两种模型上保留了几乎相同的分数,同时将预填充延迟、FLOP 和 KV 缓存内存减少了 40% 以上,并且仅产生了少量的额外推理开销。这些结果表明,词元级 隐式布局分析是加速基于 VLM 的 OCR 系统的有效且实用的方法。