论文

从手写到结构化数据:手写表格的人工智能数字化基准测试

From Handwriting to Structured Data: Benchmarking AI Digitisation of Handwritten Forms

模型评测模型能力评测

摘要

结构化手写文档的手动数字化速度缓慢且成本高昂。我们将 17 个领先的前沿多模式 大语言模型 和开源模型与非常具有挑战性的混合日期的现实世界医疗形式进行基准比较;结构化的印刷文本;手写的回答和重大的可变性挑战。较小或较旧的模型都没有表现良好,但最新的 Google 和 OpenAI 模型的准确度约为 85\%$,在离散或预定义字段中加权 F1 得分为 $\simeq 90\%$,尽管响应的性质非常具有挑战性。明显的任务特定优势显现出来:GPT 5.4 在嘈杂的日期提取以及具有最低幻觉率 ($6\%$) 的可靠性方面表现出色。 Claude Sonnet 4.6 在格式化字段(日期和数值)上具有最佳的平均性能,而 Gemini 3.1 提供了最佳的整体性能,自由文本错误率最低(WER = $0.50$ 和 CER = $0.31$),并且在离散分类指标上的结果最强。我们进一步表明,即时优化极大地提高了宏观精度、召回率和 F1 超过 $60\%$,但对加权指标影响很小(仅 $\sim2-5\%$ 改进)。这些结果证明,多模式 大语言模型 的快速改进为复杂手写工作流程的全自动数字化提供了一条引人注目的途径,这在低收入和中等收入国家尤其重要。