论文
MonkeyOCRv2:文档 AI 的视觉文本基础模型
MonkeyOCRv2: A Visual-Text Foundation Model for Document AI
摘要
主流视觉编码器是在自然图像上进行预训练的,如果没有面向文档的适应,就无法有效地应用于文档图像,因为密集的文本和细粒度的字符笔画需要字符级的视觉感知。我们推出了 MonkeyOCRv2,这是一种用于文档 AI 的视觉文本预训练模型。首先,我们构建了 MonkeyDoc v2,据我们所知,这是最大的文档图像预训练语料库,包含涵盖 17 种语言的 1.13 亿张图像。其次,我们提出了一种联合学习图像到文本生成和像素级文档重建的预训练策略:前者将视觉表示与文本内容对齐,而后者保留字符笔画和布局细节。对文本识别、公式识别、文本检测、文档篡改检测和重叠文本分割等五个代表性文档分析任务进行了广泛的实验。用 MonkeyOCRv2 替换原始编码器可以持续提高所有五项任务的性能。最后,我们验证了其作为多模态 大语言模型 视觉编码器在更具挑战性的文档解析和文档理解任务上的有效性。保持冻结并与轻量级语言模型配对,它产生了一个 0.7B 文档解析模型,该模型在 MDPBench 上树立了新的开源最先进水平,MDPBench 是一个涵盖 17 种语言的数字生成和拍摄文档的最新基准,绝对超过之前最好的 3Bdots.mocr 2.8%,而视觉编码器小了大约 11 倍。冻结编码器还支持文档理解模型,该模型在相同训练设置下的八个基准测试中优于基于 CLIP、DINO 和 SAM 构建的对应模型。这些结果表明,面向文档的视觉预训练本身可以作为文档智能的基础。