论文

通过分类引导的大型视觉语言模型从文档中提取视觉信息

Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models

上下文与知识上下文工程

摘要

由于高度的布局可变性和现实世界的缺陷,从视觉丰富的文档中提取视觉信息(VIE)仍然具有挑战性。现有方法通常依赖于顺序 OCR 管道或端到端模型,需要大量标记数据和特定于布局的训练,从而限制了其可扩展性。我们提出了一种用于多类型 VIE 的分类引导大型视觉语言模型 (LVLM) 框架,该框架以最少的监督实现了高精度。该方法将文档类型分类与内容提取分离,并采用基于上下文学习 (ICL) 的动态提示工程来注入特定于任务的知识,从而实现跨不同布局的稳健的零样本推理。从理论角度来看,所提出的方法可以被视为一种条件计算形式,可以减少任务的不确定性并提高基于提示的推理过程中的信息效率。在具有 16 种证书类型的真实投标数据集上进行评估,我们的零样本方法(基于 Qwen2.5-VL-7B)在 F1 分数(86.43\% vs. 68.08\%)方面优于强监督基线 18.35 个百分点,在归一化编辑距离方面优于强监督基线 0.23 个百分点(0.90 vs. 0.67)。可选的特定域 微调 进一步将性能提高至 93.65\% F1 和 0.93 NED,展示了针对密封、水印和低对比度的卓越鲁棒性。该框架为办公自动化中复杂的文档理解提供了高效、可扩展的解决方案。代码可在 https://github.com/FairmeHIT/Multi-VIE 获取,微调模型可在 https://huggingface.co/fairme/Qwen2.5-VL-7B-SFT 获取。