论文
通过检索增强 大语言模型 利用外部知识恢复历史文档
Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models
摘要
历史文献是无价的知识档案,但往往由于物理老化和损坏而难以辨认。虽然基于掩码语言建模的现有恢复方法有效地利用了本地上下文,但它们难以恢复需要外部历史知识的命名实体。为了解决这一限制,我们引入了一种新颖的历史文档恢复框架,该框架利用 大语言模型 和检索增强生成 (RAG)。通过将预训练的 LLM 的隐式知识与显式检索的外部上下文相结合,我们的模型 ARI 有效地减轻了推断上下文相关的专有名词的挑战。对韩国历史文献的大量实验表明,我们的方法明显优于基线,在恢复一般字符和命名实体方面取得了显着的成果。此外,包括专家评估在内的综合评估证实,ARI 作为领域专家的实用工具,有望加速历史记录的分析。