论文

超越准确率:模板文档抽取中的鲁棒性、成本与治理权衡

Beyond Accuracy: Robustness, Cost, and Governance Trade-offs for Vision-Language Models in Templated Document Extraction

模型评测模型能力评测

摘要

视觉语言模型日益用于从业务文档提取结构化字段,但多数评估只报干净基准准确率,难指导实践者按任务复杂度选型。我们以测量研究和开源发布弥补缺口。在750份合成支票留出集上,对十一种系统评分,包括三个商用、两个推理、五个预训练及微调形式的开源视觉模型,以及非大模型OCR到正则表达式基线。用3000样本微调后,最佳开源模型F1超过0.98,高于本任务所有零样本商用系统;GPT-5在商用组F1领先,Claude Sonnet 4.5在日期字段表现崩溃。为把测量转为选择,我们提出实践者选型框架,通过过滤和总成本最小化,将质量、延迟、治理、数量组成的任务画像映射为推荐方案,并以假设的中等规模文档抽取场景示例。