论文
DocAtlas:跨 80 多种语言的多语言文档理解
DocAtlas: Multilingual Document Understanding Across 80+ Languages
摘要
由于缺乏训练数据和基于模型的注释管道,导致现有偏见长期存在,因此对资源匮乏的语言的多语言文档理解仍然有限。我们引入了 DocAtlas,这是一个构建高保真 OCR 数据集和基准的框架,涵盖 82 种语言和 9 个评估任务。我们的双管道、原生 DOCX 文档的差异化渲染以及从右到左脚本的基于 LaTeX 的合成生成以统一的 DocTag 格式编码布局、文本和组件类型生成精确的结构注释,而无需学习核心注释模型。评估 16 个最先进的模型揭示了低资源脚本中持续存在的差距。我们表明,使用渲染衍生的 真值 作为正信号的直接偏好优化 (DPO) 实现了稳定的多语言适应,提高了域内 (+1.9%) 和域外 (+1.8%) 的准确性,而没有可测量的基本语言退化,其中监督 微调 使域外性能降低了高达 21%。我们最好的变体 DocAtlas-DeepSeek 比最强基线提高了 +1.7%。代码可在 https://github.com/ahmedheakl/DocAtlas 获取。