论文
TexOCR:推进可编译页面到 LaTeX 重建的文档 OCR 模型
TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction
摘要
现有文档 OCR 主要针对纯文本或 Markdown,放弃了使 LaTeX 对于科学出版至关重要的结构和可执行属性。我们研究将科学 PDF 的页面级重建为可编译的 LaTeX,并为此任务引入基准测试 TexOCR-Bench 和大规模训练语料库 TexOCR-Train。 TexOCR-Bench 具有多维评估套件,可联合评估转录保真度、结构 忠实性 和端到端可编译性。利用 TexOCR-Train,我们使用受监督的 微调 (SFT) 和强化学习 (RL) 来训练 2B 参数模型 TexOCR,并从 LaTeX 单元测试中获得可验证的奖励,直接强制执行可编译性和引用完整性。 TexOCR-Bench 上 21 个前沿模型的实验表明,现有系统经常违反关键文档不变量,包括一致的部分结构、正确的浮动位置和有效的标签引用链接,这会破坏编译可靠性和下游可用性。我们的分析进一步表明,具有可验证奖励的 RL 比单独的 SFT 产生了持续的改进,特别是在结构和编译指标方面。