论文

WildHandBench:挑战 MLLM 和人类的手写文本理解基准

WildHandBench: A Benchmark for Handwritten Text Understanding that Challenges MLLMs and Humans

模型评测基准与评测资源

摘要

虽然 OmniDocBench 上的顶级模型现在在打印文档解析方面总体达到 96.34%,但当前模型处理具有挑战性的手写文档的能力在很大程度上仍然没有得到体现。现有的基准测试侧重于孤立的文本或公式,忽略了手写表格和现实世界的退化,并报告总体准确性,但没有解释模型失败的原因。我们推出了 WildHandBench,这是一个包含 500 个手写文档的基准测试,涉及三种结构(自由文本、表格、公式)、四种语言和九种真实场景。我们引入了先验驱动错误(PDE)指标,该指标可以量化错误是否源自语言先验而不是视觉证据。通过评估 18 个最先进的模型以及校准的人类基线,我们发现:(1)最好的模型总体上仅达到 71.85%; (2) 人类优于所有模型,但差距较小(77.09% vs. 71.85%); (3) 模型错误与人为错误有本质上的不同——63-91% 的模型错误是先验驱动的,而人类只有 49% 的错误,暴露了对语言先验的系统依赖,而传统的准确性指标无法捕获。