论文

MUDIDI:使用语言模型进行多语言词典数字化的两阶段框架

MUDIDI: A Two-Stage Framework for Multilingual Dictionary Digitization with Language Models

模型评测基准与评测资源

摘要

多语言词典是资源匮乏和濒危语言最有价值的文献资源之一,但许多词典仍然只能以扫描件的形式提供。几十年来,由于特定语言的脚本、充满缩写和交叉引用的条目的复杂多列布局,它们的数字化和转换为机器可读的格式几乎是不可能的。最近的视觉语言模型提供了一个有前途的解决方案,但尚不清楚它们如何很好地保留字符、标记和处理词典结构。我们介绍 MUDIDI,一个用于多语言词典数字化的两阶段框架。第一阶段评估字符识别和标记保存的质量;第二阶段的重点是字典条目分段,随后映射到机器可读的字典模式(SIL 的多字典格式化程序)。我们还发布了一个数据集,其中包含从 30 个公共领域词典收集的人工注释词典条目,这些词典具有不同的书写系统、语系和格式。我们在数据集上对 OCR 系统、通用 大语言模型 (LLM) 和视觉语言模型 (VLM) 进行基准测试,在两个阶段中展示了 LLM 在大多数书写系统和语言中的卓越性能,并提供了针对更具挑战性的场景改进结果的实用指南。最后,我们表明,向 LLM 补充附加信息(例如词典介绍)可以提高数字化词典的质量。 Github:https://github.com/naarm-nlp/mudidi