论文
METATR:自动文本识别的多语言、不断发展的基准
METATR: A Multilingual, Evolving Benchmark for Automatic Text Recognition
摘要
反映现实世界文档的多样性和复杂性的基准对于准确评估自动文本识别 (ATR) 系统至关重要,尤其是 Vision-大语言模型 (vLLM)。尽管最近的模型表现出了令人印象深刻的性能,但它们经常在包含主要用英语编写的现代印刷文本的数据集上进行评估,这限制了它们与许多实际应用的相关性。因此,为特定用例选择模型需要根据与目标文档匹配的数据对其进行评估。这凸显了实际应用的代表性基准的重要性。在本文中,我们介绍了 METATR (v1.0),这是一种多语言、不断发展的基准,旨在评估各种文档中的 ATR 模型,促进有意义的模型比较和选择。该基准旨在通过包含来自各种公共收藏的文档来最大限度地提高多样性。这些文档涵盖 29 种语言,包括具有多种脚本和布局的文本。除了数据集本身之外,METATR 还定义了标准化的提示和标准化方法,并建立了动态评估框架。这种方法旨在产生可重复的结果,同时保持可扩展性。我们评估了各种最先进的系统,包括开源模型和闭源模型。结果报告涵盖各个维度,包括数据集和语言级别的性能、手写文档的稳健性以及计算效率。我们的研究结果表明,尽管专有模型实现了最一致的性能,但脚本和布局之间仍然存在很大的差异。总体而言,METATR 提供了一个多维、面向实践者的框架,用于评估现实条件下的多语言 ATR 并跟踪该领域的发展进展。