论文

OvisOCR2 技术报告

OvisOCR2 Technical Report

摘要

我们介绍OvisOCR2,一个0.8B的文档解析模型。 OvisOCR2 被设计为端到端解析器:给定文档页面图像,它以自然阅读顺序生成 Markdown 表示,涵盖文本、公式、表格和可视区域。我们构建了一个数据引擎,将过滤后的真实文档注释与合成页面相结合,合成页面的渲染图像和 Markdown 目标源自相同的 HTML 源。训练方法包括有监督的 微调、采用多组件奖励设计的 4B 分支上的强化学习、将 同策略 蒸馏 引入 0.8B 模型以及模型融合。在 OmniDocBench v1.6 上,OvisOCR2 取得了 96.58 的最高总分,将端到端模型置于之前由管道方法主导的排行榜顶部,凸显了端到端文档解析的潜力。在 PureDocBench 上,OvisOCR2 也取得了最高的 Avg3 分数 75.06。除了这两个公共基准之外,我们还根据内部基准评估 OvisOCR2,该基准旨在涵盖更广泛的长尾和具有挑战性的场景。 OvisOCR2 在比较方法中获得了最佳的整体性能,进一步证明了其泛化性和鲁棒性。 OvisOCR2 可在 https://huggingface.co/ATH-MaaS/OvisOCR2 上获取。