论文

ICDAR 2026 HIPE-OC LLM辅助历史文献OCR修复大赛

ICDAR 2026 HIPE-OCRepair Competition on LLM-Assisted OCR Post-Correction for Historical Documents

模型评测基准与评测资源

摘要

我们展示了 HIPE-OCRepair-2026 的结果,这是一项关于 LLM 辅助 OCR 历史文档校正后的 ICDAR 竞赛。 OCR 后校正仍然是数字遗产领域的一个长期挑战:大规模数字化文档集合受到旧 OCR 错误的影响,而大规模的重新数字化仍然不切实际。 大语言模型 (LLM) 提供了重新审视这一挑战的重要机会,但它们在语言、文档类型和噪声条件下的有效性以及它们产生幻觉的倾向仍然没有得到充分的了解。 HIPE-OCRepair-2026 追求两个目标:(i) 评估现代 OCR 后校正系统的能力,以及 (ii) 提供基于 HIPE-OCRepair-2026 数据集的可重复评估框架,HIPE-OCRepair-2026 数据集是一个统一的多语言资源,整合了现有和新整理的历史数据集。参与者的任务是纠正英语、法语和德语(17-20 世纪)历史报纸和印刷作品中嘈杂的 OCR 转录本,在连贯的转录单元(段落或文章)级别上工作,而无需访问源图像。评估采用面向检索而非外交评分的方法,反映了数字化馆藏搜索和访问的实际用例。四个团队提交了从零样本提示到持续 预训练 和 微调 的系统,提供了对不同适应策略优点的见解。结果表明,现代 LLM 辅助系统可以显着提高 OCR 质量,但性能因数据集、语言和噪声水平而异。对低噪声输入的过度校正成为一个反复出现的挑战,凸显了除了减少字符错误之外进行评估的重要性。公开发布数据集、评分器和评估流程以支持未来的研究。