论文

WildTableBench:在野外对表理解的多模态基础模型进行基准测试

WildTableBench: Benchmarking Multimodal Foundation Models on Table Understanding In the Wild

模型评测基准与评测资源

摘要

在消费者和企业场景中,使用多模态基础模型来分析表格图像是一种高价值但具有挑战性的应用。尽管它很重要,但当前的评估主要依赖于结构化文本表格或干净的渲染图像,而未充分探索自然表格图像的视觉复杂性。此类图像具有不同的布局和不同的领域,需要复杂的结构感知和数字推理。为了弥补这一差距,我们引入了 WildTableBench,这是第一个针对现实世界中自然出现的表格图像的问答基准。 WildTableBench 包含从不同领域的在线论坛和网站收集的 402 个高信息密度表格图像,以及涵盖 5 个类别 17 个子类型的 928 个手动注释和验证的问题。我们在此基准测试上评估了 21 个前沿专有和开源多模式基础模型。只有一个模型的准确率超过 50%,其余所有模型的准确率在 4.1% 到 49.9% 之间。我们进一步进行诊断分析来表征模型失败并揭示结构感知和推理中持续存在的弱点。这些结果和分析为当前模型功能提供了有用的见解,并将 WildTableBench 确立为表格图像理解的有价值的诊断基准。数据集:https://huggingface.co/datasets/jzhuang/WildTableBench 代码:https://github.com/hjzhe/WildTableBench 排行榜:https://hjzhe.github.io/WildTableBench