论文

使用基于 RAG 的实时系统改善对历史档案的访问

Improving Access to Historical Archives with Real-time RAG-based Systems

上下文与知识检索增强

摘要

数字化历史档案是大型、异构的文化遗产存储库,但此类档案的访问方法面临光学字符识别(OCR)输出噪声和严格的基于关键字检索等挑战,从而限制了检索质量。在这项工作中,我们提出了一个端到端的档案处理和检索框架,它将 大语言模型 (LLM) 集成到档案管道中。我们的系统引入了两个核心组件:(i)基于 LLM 的 OCR 细化模块,可提高文本质量;(ii)语义检索和跨编码器重排序管道,通过检索增强生成(RAG)支持自然语言问答。我们的评估是基于跨越三个世纪(1762 年至 2001 年)的 500,000 个瑞士报纸片段的历史档案数据集进行的。实验针对 384 个自然语言测试查询进行。我们的结果强调,LLM 改进可将 OCR 错误减少高达 44.52% (CER) 和 60.95% (WER)。更重要的是,这还伴随着下游信息检索的改进。与传这些结果表明,将 LLM 与已建立的文档处理和检索管道集成可以将数字图书馆从静态存储库提升为交互式、语义可搜索的档案系统。