论文

更多:多语言文档解析基准和评估

MORE: A Multilingual Document Parsing Benchmark and Evaluation

模型评测基准与评测资源

摘要

多语言文档囊括了丰富的地域文化、科学发现和历史记录。将这些内容解析为结构化的机器可读格式对于解锁全球知识至关重要。然而,现有的基准测试主要集中在英语和中文等高资源语言上,从而在其他语言上的模型性能方面造成了评估盲点。虽然最近的视觉语言模型 (VLM) 声称支持数百种语言,但缺乏 真值 使得无法凭经验验证这些功能。为了弥补这一差距,我们引入了 MORE,这是一个专为多语言文档解析评估而设计的大型基准测试。 MORE 通过三个关键维度脱颖而出: (1) 前所未有的规模:涵盖 149 种语言,使其成为迄今为止语言最多样化的基准; (2)结构复杂性:与之前的作品不同,它将评估扩展到纯文本之外,包括代码块、表格和目录等结构元素; (3) 数据真实性:所有样本都是通过模型辅助、人工细化的注释管道从现实世界文档中挑选出来的。我们使用 MORE 评估最先进的模型,为长尾语言建立新的性能基准,并验证基准在现实、多样化场景中诊断模型能力的有效性。 MORE 数据集将在 https://github.com/zimoqingfeng/MORE 提供。