论文

MDPBench:现实场景中的多语言文档解析基准

MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios

模型评测基准与评测资源

摘要

我们推出多语言文档解析基准,这是多语言数字和拍照文档解析的第一个基准。文档解析已经取得了显着的进步,但几乎完全是在少数主流语言的干净、数字、格式良好的页面上。不存在系统基准来评估模型在不同文字和低资源语言的数字和拍照文档上的表现。 MDPBench 包含 3,400 个文档图像,涵盖 17 种语言、不同的文字和不同的摄影条件,并通过严格的专家模型标记、手动校正和人工验证流程生成高质量注释。为了确保公平比较并防止数据泄露,我们保持单独的公共和私人评估划分。我们对开源和闭源模型的综合评估发现了一个惊人的发现:虽然闭源模型(特别是 Gemini3-Pro)被证明相对稳健,但开源替代方案却遭受了戏剧性的性能崩溃,特别是在非拉丁文字和现实世界拍摄的文档上,拍摄文档平均下降 17.8%,非拉丁文字平均下降 14.0%。这些结果揭示了不同语言和条件之间的显着性能不平衡,并为构建更具包容性、可部署的解析系统指明了具体方向。来源可在 https://github.com/Yuliang-Liu/MultimodalOCR 获取。