论文
BaFCo:复杂孟加拉语形式理解的文档理解基准
BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension
摘要
对于 Multimodal 大语言模型 来说,文档理解是一项具有挑战性但影响深远的任务,特别是当这些系统在现实世界、以人为中心的应用程序中得到越来越多的采用时。然而,由于缺乏高质量的注释数据,这种采用仅限于孟加拉语等资源匮乏的语言。为了解决这一差距,我们引入了 BaFCo,这是一个孟加拉语形式理解的基准数据集,重点关注文档布局分析 (DLA) 和关键信息提取 (KIE)。 BaFCo 整理了 200 份多页复杂的孟加拉国政府表格,这些表格来自农业、教育、银行和土地管理等不同部门。为了准确捕获这些表单的结构和上下文复杂性,我们定义了一个包含 26 种表单实体的细粒度注释模式,以及一个由 5 种类型组成的单独的粗表单实体集。我们在低推理和高推理设置下使用零样本和思维链提示来评估 ChatGPT、Gemini、Claude、Qwen 和 Kimi 系列的最新 MLLM。我们的结果揭示了当前 MLLM 在理解孟加拉语形式方面的能力的局限性,特别是在准确定位高度粒度形式实体方面。我们的数据集和代码位于:https://huggingface.co/datasets/Mausul/bafco