论文
修订:使用数据污染策略修订实用信息系统中的 ORed 文本的框架
Revise: A Framework for Revising OCRed text in Practical Information Systems with Data Contamination Strategy
摘要
大语言模型(LLM)的最新进展显着改善了文档人工智能领域,在问答等文档理解任务上表现出了卓越的性能。然而,现有方法主要侧重于解决特定任务,缺乏结构化组织和管理文档信息的能力。为了解决这个限制,我们提出了 Revise,一个可以系统地纠正 OCR 在字符、单词和结构级别引入的错误的框架。具体来说,Revise 采用了常见 OCR 错误的全面分层分类法和合成数据生成策略,可以真实地模拟此类错误,以训练有效的校正模型。实验结果表明,Revise 可以有效纠正 OCR 输出,从而实现文档内容的更结构化表示和系统管理。因此,我们的方法显着增强了文档检索和问答任务的下游性能,凸显了克服现有文档人工智能框架的结构管理限制的潜力。