论文

从像素到结构:用于文档 OCR 和结构化 JSON 提取的轻量级视觉语言模型

From Pixels to Structure: Lightweight Vision-Language Models for Document OCR and Structured JSON Extraction

应用与实践模型训练模型评测监督微调与指令调优模型能力评测行业应用

摘要

虽然大规模、闭源视觉语言模型 (VLM) 为文档理解设定了强有力的基准,但由于数据自治问题、经常性成本和超大规模计算的环境足迹,它们对商业 API 的依赖限制了机构档案中的采用。这在遗产数字化中尤其严重,其中文档包括历史笔迹、特定领域术语(例如珠宝、史前史、建筑)以及需要高维结构化提取的非标准布局。我们对三个大学遗产收藏中用于光学字符识别 (OCR) 的八个开源轻量级 VLM(最多 7B 参数)进行了比较研究。给定文档图像,模型必须提取文本并生成符合架构的 JSON,从而实现自动验证和下游使用。我们在零样本、少样本和微调设置的约束感知协议下评估模型,使用字符错误率 (CER)、近似归一化编辑来测量提取保真度和结构化输出质量 Similarity (ANLS*), and mean Average Precision F1 (mAP-F1).针对微调基线,我们进一步测试 (i) 超参数优化、(ii) 经典图像预处理(照明平坦化、去噪和 CLAHE)和 (iii) 多阶段训练的独立影响。最后,我们分析了特定于数据集的微调和单个多数据集检查点之间的权衡,其中联合训练使一个模型能够跨集合运行,但可以在数据集之间改变性能。总体而言,我们表明,精心调整的具有高达 7B 参数的 VLM 可以为手动转录或商业黑盒系统提供可持续、私密、高性能的替代方案,并且我们为寻求机构控制的 OCR 到 JSON 提取的遗产机构提供可行的指导。