论文

SynthDocBench:长上下文视觉文档理解的受控基准

SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding

模型评测基准与评测资源

摘要

视觉语言模型 (VLM) 在 DocVQA、ChartQA 和 MMLongBench-Doc 等视觉文档理解基准上取得了出色的性能。然而,现实世界的文档结合了长度、布局复杂性、模态和问题难度等多种因素,这使得很难将模型失败归因于特定原因。我们推出了 SynthDocBench,这是一个用于长上下文视觉文档理解的完全综合基准,可以系统地控制文档长度、布局结构、模态组成和问题类型等因素。该基准是使用组合设计构建的,每个因素在生成的文档中独立变化,从而能够对模型行为进行受控分析。文档是使用跨六种布局原型的 LLM 管道端到端生成的,并具有 40% 的随机覆盖率,以防止模型利用虚假相关性。此外,SynthDocBench 涵盖了长上下文文档,其长度和结构多样性比现有基准要大得多。通过评估七个前沿 VLM,我们发现了现有基准无法揭示的三种故障模式:随着文档长度的急剧下降,系统位置敏感性,其中文档的中间三分之一对于六个模型中的五个来说是最困难的,并且六个模型中的五个显示出负面的早期到晚期趋势(最大幅度下降:8.3 个百分点),以及长文档设置中图表理解的崩溃。这些结果表明,当前的模型可能过度拟合基准工件,而不是实现强大的长上下文视觉文档理解。