论文

评估梵文 OCR 后校正的上下文学习和检索策略

Evaluating In-Context Learning and Retrieval Strategies for Devanagari Post-OCR Correction

上下文与知识检索增强

摘要

使用大型语言模型 (LLM) 的上下文学习提供了一条无需训练的 OCR 后校正的引人注目的途径,但其对梵文脚本的有效性仍然完全未经探索。我们首次对印地语和马拉地语 OCR 后校正的 LLM (3B-32B) 进行了系统评估,比较了三种上下文中的示例检索策略:域随机选择、密集语义检索和我们提出的 CharBM25,该策略通过 OCR 输入上的字符 n-gram BM25 相似性来检索示例,以与测试句子共享错误模式。在跨越五个新闻领域的 20,000 个句子基准中,检索策略是校正质量的决定性因素:CharBM25 使用字符三元组,在印地语上比域随机选择高 2.8-4.0 个百分点,在马拉地语上比域随机选择高 2.9-3.8 个百分点,而字符三元组的性能始终优于二元组和一元组。规模主导性能:在 CharBM25-5 下,Gemma-3-27B 使印地语的 WER 降低了 55.0%,马拉地语的 WER 降低了 33.3%。很少的镜头增益是容量门控的:低于 8B 的模型无法可靠地改进 OCR 基线,而在马拉地语中,最小的模型 (3B) 降低的句子多于改进的句子。在所有尺度上,马拉地语始终比印地语更难纠正,这反映出其形态更加复杂。这些发现将 CharBM25 确立为一种有效的、无需 GPU 的检索策略,能够以可忽略不计的计算成本匹配或超过密集检索,并表明将其与 12B+ 参数的通用 LLM 相结合可提供可靠、免训练的 Devanagari 后 OCR 校正,无需针对特定任务进行微调。数据集:此 https URL