论文

ABot-OCR技术报告

ABot-OCR Technical Report

模型训练强化学习

摘要

我们介绍 ABot-OCR,这是一种端到端视觉语言模型,可通过一次前向传递将页面图像直接转录为干净的 Markdown。通过这样做,我们的方法完全消除了对脆弱的模块化编排的需要。为了最大限度地提高解析保真度,我们开发了专用的数据引擎来提供大规模、结构一致的监督。此外,我们提出了解耦异构文档优化,这是一种结构约束的强化学习方法,可以提高文本准确性并严格执行标记的格式良好性,超越单独的监督 微调。广泛的评估证明了我们框架的卓越性能。在 OmniDocBench v1.5 和 v1.6 基准测试中,ABot-OCR 在所有端到端系统中获得了 92.81 和 93.30 的最高分数,大大缩小了与强大的管道基线相比的性能差距。最后,跨十种不同语言的全面多语言文本识别进一步证实了 ABot-OCR 强大的通用性。