论文
INDOTABVQA:印尼语文档中跨语言表理解的基准
INDOTABVQA: A Benchmark for Cross-Lingual Table Understanding in Bahasa Indonesia Documents
摘要
我们引入了 INDOTABVQA,这是一个评估印尼语真实世界文档图像的跨语言表格视觉问答 (VQA) 的基准。该数据集包含 1,593 个跨越三种视觉风格(有边框、无边框和彩色)的文档图像以及一个或多个表格,以及四种语言的 1,593 个问答集:印度尼西亚语、英语、印地语和阿拉伯语。这使得能够在单语言(带有印尼语问题的印尼语文档)和跨语言设置(带有其他语言问题的印尼语文档)中评估视觉语言模型(VLM)。我们对领先的开源 VLM(Qwen2.5-VL、Gemma-3、LLaMA-3.2)和 GPT-4o 进行基准测试,并揭示了巨大的性能差距,特别是在结构复杂的表和低资源语言中。 微调 是我们数据集上紧凑的 3B 和 LoRA 微调的 7B 模型,准确率分别提高了 11.6% 和 17.8%。提供显式表区域坐标作为附加输入,可将性能进一步提高 4-7%,这证明了空间先验对于基于表的推理的价值。我们的研究结果强调了语言多样化、特定领域数据集的重要性,并证明有针对性的 微调 可以显着提高 VLM 在专门文档理解任务上的性能。 INDOTABVQA 为推进跨语言、结构感知文档理解的研究提供了宝贵的资源,特别是在世界上代表性不足的地区。完整数据集可以在 Huggingface 中访问:https://huggingface.co/datasets/NusaBharat/INDOTABVQA}