论文
TeleOCR:跨数字和相机捕获的文档进行文档解析导航
TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
摘要
文档解析旨在将非结构化文档转换为结构化且机器可读的表示形式。视觉语言模型 (VLM) 的最新进展显着提高了文档解析的性能。然而,现有方法仍然面临两大挑战。首先,基于解耦 VLM 的方法严重依赖于精确的布局分析,其中相机捕获的文档中的几何失真可能会引入级联错误。其次,虽然基于端到端 VLM 的方法减轻了对显式布局检测的依赖,但它们在高分辨率场景中经常会出现冗余生成、幻觉和结构推理不足的问题。为了应对这些挑战,我们提出了 TeleOCR,这是一个统一的文档解析框架。 TeleOCR 引入了变形感知学习,将几何感知融入 VLM 中,并提出了一种用于复杂布局表示的自适应采样机制。此外,还开发了内容结构解耦学习策略来显式建模公式语法和表格结构,从而实现更有效的结构化表示学习。大量实验表明,TeleOCR 在不同的文档解析基准测试中实现了最先进的性能。它在OmniDocBench v1.6、Wild-OmniDocBench和PureDocBench上分别获得96.87、88.53和78.41的总分,在ICDAR 2026 Sci-ImageMiner Challenge中排名第一。这些结果验证了 TeleOCR 在复杂文档解析场景中的有效性和泛化能力。