论文

DocAnnot——利用 GenAI 支持的自动注释加速关键信息提取数据集的创建

DocAnnot -- Accelerating the Creation of Key Information Extraction Datasets with GenAI-Powered Auto-annotation

模型训练合成数据

摘要

关键信息提取 (KIE) 对于许多文档应用程序至关重要,但创建训练数据集传统上是一个耗时的手动过程。我们引入了 DocAnnot,一个可以显着加速 KIE 数据集生成的框架。 DocAnnot 利用大视觉语言模型 (LVLM) 进行标签值提取,利用 OCR 进行文本/边界框检测,以及一种新颖的空间信息上下文匹配 (SICM) 算法。 SICM 通过将空间关系和邻近分析与文本匹配相结合来改进标签值关联。我们在 CORD 和 SROIE 基准上评估我们的框架,证明其自动生成注释的能力,F1 分数分别为 0.679 和 0.846。此外,我们研究了对 微调 下游 KIE 模型使用自动注释数据的有效性。虽然人工注释的数据仍然优越,但专门根据 DocAnnot 输出训练的模型获得了可观的性能(例如,LayoutLMv3 在 CORD 上实现了 0.6765 的 F1 分数)。这些结果表明,虽然我们的框架显着减少了对人工的依赖,但它尚未完全消除人工干预的需要。然而,通过将流程自动化到审阅者可以有效地完善输出的程度,我们的系统可以实现近乎完美的注释,其效率比从头开始的手动注释要高得多。这种方法可以节省大量时间和成本,对于资源有限的环境和快速模型原型设计非常有价值。