论文

高风险公共部门应用中开放模型结构化信息抽取的评估

Evaluating Structured Information Extraction with Open Models in a High Risk Public Sector Application

模型评测基准与评测资源

摘要

从非结构化文档中抽取结构化信息是所有行业数字化转型的关键组成部分。虽然商业应用由专有方案主导,但快速成长的开源生态——光学字符识别(OCR)引擎、大语言模型(LLM)和视觉语言模型(VLM)——提供了可及的替代方案。然而,针对现实的、多步骤抽取管线的系统性评估仍然稀缺。负责任地使用此类抽取工具,需要在真实任务上进行全面评估,尤其当这些方案将成为欧盟AI法案归类为高风险的公共部门应用的关键组件时。为填补这一空白,我们提出了一个综合基准,评估开源系统在一个被归类为高风险的复杂真实文档处理任务上的端到端表现:国际留学项目的学生申请。我们使用最先进的OCR引擎、LLM和VLM进行了全面的实证评估。我们的结果显示,尽管VLM总体上优于OCR+LLM管线,但即便最先进的开源模型在零样本设置下也难以可靠地处理此类任务。35个配置中只有4个的F1得分超过0.5,最好的OCR+LLM管线可以匹配顶级VLM的表现,但大多数OCR+LLM组合的表现明显更差。约75%的配置得分低于0.25。模型规模会影响性能,但关系是非线性的:规模大得多的模型并不能保证成比例的更好结果。输入质量,尤其是OCR输出的结构保真度,成为独立于下游模型能力的关键因素。

高风险公共部门应用中开放模型结构化信息抽取的评估:论文配图
图1:匿名化后的示例文档。