论文

HakushoBench:来自政府白皮书的日本图表和表格 VQA 基准

HakushoBench: A Japanese Chart and Table VQA Benchmark from Governmental White Papers

模型评测基准与评测资源

摘要

理解图表和表格图像对于将视觉语言模型 (VLM) 应用于现实世界的文档理解至关重要。尽管英语基准测试进展迅速,但非英语基准测试仍然稀缺,因此尚不清楚这种进步是否适用于各种语言。一个主要障碍是难以大规模收集真实且多样化的非英语图表和表格图像。为了解决这个问题,我们利用政府白皮书作为基准构建的来源,因为它们包含跨不同格式和领域的自然出现的图表和表格,并且可以在许多国家免费访问。作为第一个实例,我们介绍 HakushoBench,这是一个根据 33 份政府白皮书构建的日本图表和表格 VQA 基准。 HakushoBench 包含 2,053 张图像,涵盖 10 多种图像类型,并带有手动注释和独立验证的 QA 对,旨在评估对图表和表格的整体理解,而不仅仅是局部视觉线索。各种 VLM 的实验表明,HakushoBench 比现有的日本基准要难得多,并且对于开放权重模型仍然具有挑战性:低于 10B 的开放权重模型最多达到 58.6% 的准确率,甚至旗舰开放权重模型 Qwen3.5-397B-A17B 也落后 Gemini~3~Pro 8.1 个点(85.8% vs. 93.9%),凸显了复杂图表中的巨大改进空间以及表格的理解。我们发布了我们的数据集和代码。